Релиз модели22 сентября 2026 г., 13:48 МСК🤖 Auto

Qwen-Image-2.1 GGUF: Локальная генерация изображений без цензуры

Появились квантованные версии модели Qwen-Image-2.1 для ComfyUI. Модель работает на 7B параметров, поддерживает полный обход фильтров безопасности и оптимизирована для работы с ограниченным VRAM.

Баннер новости 8035

Что произошло

На платформе Hugging Face появилась репозиторий abenzerps/Qwen-Image-2.1-GGUF, содержащая квантованные веса базовой модели Qwen/Qwen-Image-2.1. Это позволяет локально запускать генерацию изображений с использованием формата GGUF, который обеспечивает высокую совместимость с различными аппаратными конфигурациями. Особое внимание привлекает тот факт, что данная версия является полностью uncensored (без цензуры): модель не имеет встроенных фильтров безопасности и генерирует контент любого типа (включая NSFW) исключительно на основе промпта пользователя.

Технические характеристики и метрики

Модель имеет архитектуру на 7 миллиардов параметров. Для оптимизации использования памяти разработчики предлагают несколько уровней квантования. Ниже приведена таблица доступных файлов, их размеров и рекомендаций по использованию:

Квантование Файл Размер Рекомендация
Q8_0 qwen-image-2.1-Q8_0.gguf 7.59 GB Максимальное качество
Q6_K qwen-image-2.1-Q6_K.gguf 5.88 GB —
Q5_K_M qwen-image-2.1-Q5_K_M.gguf 5.22 GB —
Q4_K_M qwen-image-2.1-Q4_K_M.gguf 4.60 GB Оптимальный баланс
Q4_0 qwen-image-2.1-Q4_0.gguf 4.05 GB Минимальный размер

Инфраструктура: Text Encoder и VAE

Для работы в среде ComfyUI требуются дополнительные компоненты. Доступны два варианта текстового энкодера (Text Encoder) на базе Qwen3VL 8B и VAE. Выбор энкодера зависит от объема доступной видеопамяти:

  • BF16 (17.53 GB): Полная точность, требует много VRAM.
  • Int8 (9.35 GB): Оптимизированная версия, рекомендуемая для экономии ресурсов.
  • VAE (676 MB): Стандартный декодер изображения в BF16.

Оптимизация памяти и производительности

Ключевая особенность работы с этой моделью — разделение нагрузки между GPU и CPU. Рекомендуется держать GGUF диффузионную модель в VRAM (для скорости сэмплирования), а текстовый энкодер перенести в системную RAM (CPU). Поскольку текстовый кодировщик выполняется только один раз на промпт, такая конфигурация экономит 9–17 GB VRAM практически без потери скорости генерации. Для систем с критически нехваткой памяти предусмотрен аргумент запуска --lowvram.

Как запустить

Для корректной работы необходимо использовать форк leejet/ComfyUI-GGUF (а не старый city96), так как он поддерживает архитектуру Qwen-Image 2.1. В настройках ComfyUI нужно заменить стандартный UNETLoader на Unet Loader (GGUF), а тип текстового энкодера указать как qwen_image. Лицензия модели — Qwen Research License.

Источник: Huggingface ↗