Два пути: стабильность против скорости
ByteShape представила Qwen-Image-2512, свою первую модель генерации изображений. Ключевая особенность релиза — два формата развертывания, адаптированных под разные задачи. GGUF-модели рассчитаны на работу в ComfyUI и stable-diffusion.cpp, обеспечивая кроссплатформенность (Windows, macOS, Linux, AMD, Apple Silicon). Humming-модели предназначены для движка vLLM-Omni, работают только на NVIDIA (Linux, SM75+) и предлагают значительно более высокую скорость генерации, хотя интеграция пока находится в экспериментальной стадии.
Производительность и метрики
На тестовой станции NVIDIA RTX PRO 6000 Blackwell при разрешении 1024×1024 и 20 шагах генерации Humming-версия справляется за 8–9 секунд, тогда как GGUF требует 21–24 секунд. Это делает Humming-путь почти в 2.5 раза быстрее. Обе версии поддерживают CPU-offload, что позволяет запускать модели на видеокартах с меньшим объемом памяти, хотя это и увеличивает время отклика.
Качество против квантования
Интересный вывод исследователей: более высокая численная точность не всегда гарантирует лучшее визуальное качество. BF16-версия иногда проигрывает квантованным моделям, а версии с квантованием от 4 bpw и выше практически неотличимы от BF16 по качеству изображения. Это дает пользователям гибкость в выборе баланса между скоростью и качеством.
Требования к VRAM и размеры моделей
Модели оптимизированы для локального запуска. При использовании CPU-offload пиковое потребление VRAM для самых агрессивных квантований составляет около 15–16 ГБ для 1024×1024 и менее 10 ГБ для 512×512. Ниже приведена сравнительная таблица характеристик для разных уровней квантования.
| Формат | Квантование | Размер на диске | VRAM (GPU only) | VRAM (CPU offload) | Время (GGUF) | Время (Humming) |
|---|---|---|---|---|---|---|
| GGUF | Q3_K_S (3.04 bpw) | 23.26 GB | 29.67 GB | 15.49 GB | 27.93 s | 23.63 s |
| GGUF | Q6_K (6.61 bpw) | 32.37 GB | 38.15 GB | 23.97 GB | 21.26 s | 23.97 s |
| GGUF | BF16 (baseline) | 56.35 GB | 60.42 GB | 46.23 GB | 21.68 s | 26.09 s |
| Humming | Q3_K_S (3.04 bpw) | 23.26 GB | 29.67 GB | — | — | 27.93 s |
| Humming | Q6_K (6.61 bpw) | 32.37 GB | 38.15 GB | — | — | 23.97 s |
| Humming | BF16 (baseline) | 56.35 GB | 60.42 GB | — | — | 26.09 s |
Примечание: Время указано для генерации одного изображения 1024×1024, 20 шагов, Euler sampler, cfg 2.5. Данные получены на NVIDIA RTX PRO 6000 Blackwell.
Как начать работу
Для запуска через ComfyUI необходимо установить Python 3.13, клонировать репозиторий ComfyUI, добавить расширение ComfyUI-GGUF и загрузить три компонента: основную диффузионную модель, VAE и текстовый энкодер. Для Humming-пути требуется vLLM-Omni с поддержкой Humming-ядер. Оба пути поддерживают загрузку через Hugging Face, где доступны руководства по настройке.
Источник: Byteshape ↗
