Архитектура и эффективность
В отличие от предыдущей версии Qwen-Image (20B), новая модель Qwen-Image-2.1 значительно компактнее, но сохраняет высокую производительность. Архитектура состоит из двух основных компонентов:
- Диффузионный трансформер (DiT): 7 миллиардов параметров, 32 слоя, однопоточный дизайн с блочно-каузальным вниманием.
- Текстовый энкодер: Qwen3-VL на 8 миллиардов параметров, кодирующий текстовые инструкции и условные изображения в единое представление.
Ключевое техническое преимущество — mixed-granularity attention. Текст обрабатывается с каузальной маской, а изображения — с двунаправленной маской на уровне чанков. Это позволяет вычислять текстовые токены и условные изображения только на первом шаге, а затем переиспользовать KV-кэш для всех последующих шагов денормализации. Экономия памяти и времени растет пропорционально количеству референсных изображений (до 10 штук).
Функциональные возможности
Модель поддерживает несколько режимов работы в одном чекпоинте:
- Генерация с прозрачностью: Нативный вывод в формате RGBA (2048x2048 по умолчанию, до 2752x1536).
- Многореференсное редактирование: Поддержка до 10 изображений-примеров для стиля или контента.
- Локальный контроль: Точечные правки через маски, круги или нарисованные аннотации с сохранением идентичности объектов.
Бенчмарки и сравнения
На внутреннем датасете Qwen-Image-Bench модель показала следующие результаты, став лидером среди открытых весов:
| Модель | Параметры (DiT) | Результат (Qwen-Image-Bench) | Тип лицензии |
|---|---|---|---|
| Qwen-Image-2.1 | 7B | 60.28 | Qwen Research License |
| Nano Banana 2.0 | — | 59.82 | — |
| FLUX 2 Max | 32B | 55.33 | Open Weight |
| GPT Image 2.5 Sunburst | — | 67.01 | Закрытая (API) |
Деплой и совместимость
Модель поддерживает Day 0 интеграцию с популярными фреймворками:
- Diffusers & ComfyUI: Нативные ноды и конвертированные веса.
- vLLM-Omni & SGLang: Поддержка FP8-квантования, CUDA Graphs и мульти-GPU параллелизма.
- Аппаратная совместимость: NVIDIA, AMD Radeon (через ROCm) и 8 платформ через FlagOS.
Для коммерческого использования требуется отдельная лицензия от Qwen. Для исследовательских целей и оценки доступность полная.
Бенчмарки
| Бенчмарк | Qwen-Image-2.1 | FLUX 2 Max | GPT Image 2.5 Sunburst | Nano Banana 2.0 |
|---|---|---|---|---|
| Qwen-Image-Bench | 60.28% | 55.33% | 67.01% | 59.82% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
