Инструменты1 августа 2026 г., 15:45 МСК🤖 Auto

Qwen-Image-2512: первый генератор изображений от ByteShape с поддержкой Humming

ByteShape выпустила Qwen-Image-2512 — первую модель генерации изображений с двумя путями развертывания: стабильным GGUF для ComfyUI и экспериментальным Humming для vLLM-Omni, обеспечивающим ускорение в 2.5 раза.

Баннер новости 4878

Два пути: стабильность против скорости

ByteShape представила Qwen-Image-2512, свою первую модель генерации изображений. Ключевая особенность релиза — два формата развертывания, адаптированных под разные задачи. GGUF-модели рассчитаны на работу в ComfyUI и stable-diffusion.cpp, обеспечивая кроссплатформенность (Windows, macOS, Linux, AMD, Apple Silicon). Humming-модели предназначены для движка vLLM-Omni, работают только на NVIDIA (Linux, SM75+) и предлагают значительно более высокую скорость генерации, хотя интеграция пока находится в экспериментальной стадии.

Производительность и метрики

На тестовой станции NVIDIA RTX PRO 6000 Blackwell при разрешении 1024×1024 и 20 шагах генерации Humming-версия справляется за 8–9 секунд, тогда как GGUF требует 21–24 секунд. Это делает Humming-путь почти в 2.5 раза быстрее. Обе версии поддерживают CPU-offload, что позволяет запускать модели на видеокартах с меньшим объемом памяти, хотя это и увеличивает время отклика.

Качество против квантования

Интересный вывод исследователей: более высокая численная точность не всегда гарантирует лучшее визуальное качество. BF16-версия иногда проигрывает квантованным моделям, а версии с квантованием от 4 bpw и выше практически неотличимы от BF16 по качеству изображения. Это дает пользователям гибкость в выборе баланса между скоростью и качеством.

Требования к VRAM и размеры моделей

Модели оптимизированы для локального запуска. При использовании CPU-offload пиковое потребление VRAM для самых агрессивных квантований составляет около 15–16 ГБ для 1024×1024 и менее 10 ГБ для 512×512. Ниже приведена сравнительная таблица характеристик для разных уровней квантования.

Формат Квантование Размер на диске VRAM (GPU only) VRAM (CPU offload) Время (GGUF) Время (Humming)
GGUF Q3_K_S (3.04 bpw) 23.26 GB 29.67 GB 15.49 GB 27.93 s 23.63 s
GGUF Q6_K (6.61 bpw) 32.37 GB 38.15 GB 23.97 GB 21.26 s 23.97 s
GGUF BF16 (baseline) 56.35 GB 60.42 GB 46.23 GB 21.68 s 26.09 s
Humming Q3_K_S (3.04 bpw) 23.26 GB 29.67 GB 27.93 s
Humming Q6_K (6.61 bpw) 32.37 GB 38.15 GB 23.97 s
Humming BF16 (baseline) 56.35 GB 60.42 GB 26.09 s

Примечание: Время указано для генерации одного изображения 1024×1024, 20 шагов, Euler sampler, cfg 2.5. Данные получены на NVIDIA RTX PRO 6000 Blackwell.

Как начать работу

Для запуска через ComfyUI необходимо установить Python 3.13, клонировать репозиторий ComfyUI, добавить расширение ComfyUI-GGUF и загрузить три компонента: основную диффузионную модель, VAE и текстовый энкодер. Для Humming-пути требуется vLLM-Omni с поддержкой Humming-ядер. Оба пути поддерживают загрузку через Hugging Face, где доступны руководства по настройке.

Источник: Byteshape ↗