Архитектурная оптимизация: замена гигантского энкодера
Основная инновация Zen Image Edit заключается в замене оригинального текстового энкодера Qwen3-VL-8B (17.5 ГБ) на значительно более легкую модель Qwen3.5-0.8B (1.7 ГБ). Чтобы компенсировать потерю выразительности, разработчики внедрили внутри DiT-трансформера специальный текстовый слияния адаптер (text-fusion adapter) объемом 158M параметров. Этот адаптер был дообучен на реальных геометриях инференса (условия до ~2000 токенов при 1024 px), что позволило сохранить точность понимания текста и визуальных подсказок.
Ключевые технические характеристики
Модель объединяет в себе возможности генерации «текст-в-изображение», редактирования сцены и персонажей, а также создания изображений с прозрачным фоном (RGBA). Ниже приведено сравнение ключевых компонентов оригинальной и оптимизированной моделей:
| Параметр | Qwen-Image-2.1 (Оригинал) | Zen Image Edit (AiArtLab) |
|---|---|---|
| Текстовый энкодер | Qwen3-VL-8B (17.5 GB) | Qwen3.5-0.8B (1.7 GB) + 158M адаптер |
| DiT Трансформер | Qwen-Image-2.1 DiT (32 слоя) | Qwen-Image-2.1 DiT (32 слоя) |
| Потребление VRAM | >20 GB (зависит от конфигурации) | ~17.5 GB (fp16), можно снизить через CPU offload |
| Разрешение по умолчанию | 1024x1024 | 1024x1024 (сохраняет пропорции условия) |
| Сэмплер | Dynamic Shift | FlowMatchEulerDiscreteScheduler (Static Shift 5.0) |
Функционал редактирования и ограничения
Zen Image Edit поддерживает сложное редактирование с использованием до трех условных изображений. Первая картинка выступает в роли «холста» (target), а последующие — как источники для переноса идентичности, освещения или композиции. Например, можно заменить персонажа на фото, сохранив его позу и одежду, но изменив фон.
Разработчики честно указывают на текущие ограничения модели:
- Язык: Поддерживается только английский. Использование других языков приводит к деградации качества.
- Текст на вывесках: Модель плохо справляет с цифрами и знаками (пример: «OPEN 24 HOURS» может превратиться в «OPEN 26 HOURS»).
- Точность переноса: Качество зависит от исходных фотографий; не-фотографические референсы передаются менее точно.
- Потребление памяти: При батче >1 и разрешении 1024px требуется до 28 ГБ VRAM. Рекомендуется запускать по одному запросу.
Интеграция и использование
Модель доступна на Hugging Face в формате Diffusers и поддерживает работу через CLI и ComfyUI. Для использования в ComfyUI доступна готовая нода и воркфлоу, не требующие загрузки тяжелого 17.5 ГБ энкодера. Установка осуществляется через стандартный pip с указанием кастомного пайплайна:
pipe = DiffusionPipeline.from_pretrained("AiArtLab/zen-image-edit", custom_pipeline="pipeline", trust_remote_code=True, dtype=torch.float16)
Лицензия модели производная от Qwen RESEARCH LICENSE AGREEMENT, при этом компонент Qwen3.5-0.8B распространяется под Apache License 2.0.
Источник: Huggingface ↗
