Что произошло
На платформе Hugging Face появилась репозиторий abenzerps/Qwen-Image-2.1-GGUF, содержащая квантованные веса базовой модели Qwen/Qwen-Image-2.1. Это позволяет локально запускать генерацию изображений с использованием формата GGUF, который обеспечивает высокую совместимость с различными аппаратными конфигурациями. Особое внимание привлекает тот факт, что данная версия является полностью uncensored (без цензуры): модель не имеет встроенных фильтров безопасности и генерирует контент любого типа (включая NSFW) исключительно на основе промпта пользователя.
Технические характеристики и метрики
Модель имеет архитектуру на 7 миллиардов параметров. Для оптимизации использования памяти разработчики предлагают несколько уровней квантования. Ниже приведена таблица доступных файлов, их размеров и рекомендаций по использованию:
| Квантование | Файл | Размер | Рекомендация |
|---|---|---|---|
| Q8_0 | qwen-image-2.1-Q8_0.gguf | 7.59 GB | Максимальное качество |
| Q6_K | qwen-image-2.1-Q6_K.gguf | 5.88 GB | — |
| Q5_K_M | qwen-image-2.1-Q5_K_M.gguf | 5.22 GB | — |
| Q4_K_M | qwen-image-2.1-Q4_K_M.gguf | 4.60 GB | Оптимальный баланс |
| Q4_0 | qwen-image-2.1-Q4_0.gguf | 4.05 GB | Минимальный размер |
Инфраструктура: Text Encoder и VAE
Для работы в среде ComfyUI требуются дополнительные компоненты. Доступны два варианта текстового энкодера (Text Encoder) на базе Qwen3VL 8B и VAE. Выбор энкодера зависит от объема доступной видеопамяти:
- BF16 (17.53 GB): Полная точность, требует много VRAM.
- Int8 (9.35 GB): Оптимизированная версия, рекомендуемая для экономии ресурсов.
- VAE (676 MB): Стандартный декодер изображения в BF16.
Оптимизация памяти и производительности
Ключевая особенность работы с этой моделью — разделение нагрузки между GPU и CPU. Рекомендуется держать GGUF диффузионную модель в VRAM (для скорости сэмплирования), а текстовый энкодер перенести в системную RAM (CPU). Поскольку текстовый кодировщик выполняется только один раз на промпт, такая конфигурация экономит 9–17 GB VRAM практически без потери скорости генерации. Для систем с критически нехваткой памяти предусмотрен аргумент запуска --lowvram.
Как запустить
Для корректной работы необходимо использовать форк leejet/ComfyUI-GGUF (а не старый city96), так как он поддерживает архитектуру Qwen-Image 2.1. В настройках ComfyUI нужно заменить стандартный UNETLoader на Unet Loader (GGUF), а тип текстового энкодера указать как qwen_image. Лицензия модели — Qwen Research License.
Источник: Huggingface ↗
