Релиз модели25 сентября 2026 г., 15:49 МСК🤖 Auto

Zen Image Edit: Легковесный 7B-модель для редактирования изображений

Команда AiArtLab представила Zen Image Edit — оптимизированную версию Qwen-Image-2.1 с легким текстовым энкодером Qwen3.5-0.8B, позволяющую генерировать и редактировать изображения с потреблением VRAM около 17.5 ГБ.

Баннер новости 8269

Архитектурная оптимизация: замена гигантского энкодера

Основная инновация Zen Image Edit заключается в замене оригинального текстового энкодера Qwen3-VL-8B (17.5 ГБ) на значительно более легкую модель Qwen3.5-0.8B (1.7 ГБ). Чтобы компенсировать потерю выразительности, разработчики внедрили внутри DiT-трансформера специальный текстовый слияния адаптер (text-fusion adapter) объемом 158M параметров. Этот адаптер был дообучен на реальных геометриях инференса (условия до ~2000 токенов при 1024 px), что позволило сохранить точность понимания текста и визуальных подсказок.

Ключевые технические характеристики

Модель объединяет в себе возможности генерации «текст-в-изображение», редактирования сцены и персонажей, а также создания изображений с прозрачным фоном (RGBA). Ниже приведено сравнение ключевых компонентов оригинальной и оптимизированной моделей:

Параметр Qwen-Image-2.1 (Оригинал) Zen Image Edit (AiArtLab)
Текстовый энкодер Qwen3-VL-8B (17.5 GB) Qwen3.5-0.8B (1.7 GB) + 158M адаптер
DiT Трансформер Qwen-Image-2.1 DiT (32 слоя) Qwen-Image-2.1 DiT (32 слоя)
Потребление VRAM >20 GB (зависит от конфигурации) ~17.5 GB (fp16), можно снизить через CPU offload
Разрешение по умолчанию 1024x1024 1024x1024 (сохраняет пропорции условия)
Сэмплер Dynamic Shift FlowMatchEulerDiscreteScheduler (Static Shift 5.0)

Функционал редактирования и ограничения

Zen Image Edit поддерживает сложное редактирование с использованием до трех условных изображений. Первая картинка выступает в роли «холста» (target), а последующие — как источники для переноса идентичности, освещения или композиции. Например, можно заменить персонажа на фото, сохранив его позу и одежду, но изменив фон.

Разработчики честно указывают на текущие ограничения модели:

  • Язык: Поддерживается только английский. Использование других языков приводит к деградации качества.
  • Текст на вывесках: Модель плохо справляет с цифрами и знаками (пример: «OPEN 24 HOURS» может превратиться в «OPEN 26 HOURS»).
  • Точность переноса: Качество зависит от исходных фотографий; не-фотографические референсы передаются менее точно.
  • Потребление памяти: При батче >1 и разрешении 1024px требуется до 28 ГБ VRAM. Рекомендуется запускать по одному запросу.

Интеграция и использование

Модель доступна на Hugging Face в формате Diffusers и поддерживает работу через CLI и ComfyUI. Для использования в ComfyUI доступна готовая нода и воркфлоу, не требующие загрузки тяжелого 17.5 ГБ энкодера. Установка осуществляется через стандартный pip с указанием кастомного пайплайна:

pipe = DiffusionPipeline.from_pretrained("AiArtLab/zen-image-edit", custom_pipeline="pipeline", trust_remote_code=True, dtype=torch.float16)

Лицензия модели производная от Qwen RESEARCH LICENSE AGREEMENT, при этом компонент Qwen3.5-0.8B распространяется под Apache License 2.0.

Источник: Huggingface ↗