Что произошло
На платформе Hugging Face появилась репозиторий MiniMax-H3 × Z-Image, содержащая прuned (обрезанные) веса модели MiniMax-H3, адаптированные для работы в ComfyUI. Автор загрузки, joeygambino, предоставил широкий спектр квантованных версий, позволяющих запускать мощную модель на потребительских видеокартах с ограниченным объемом памяти.
Технические детали и форматы
Модель доступна в различных форматах квантования, что дает пользователям выбор между скоростью, качеством и требованиями к «железу». Особое внимание стоит уделить форматам NVFP4 и W4A4, которые обеспечивают минимальный размер весов. Также доступна версия mxfp8 (microscaling precision), специфичная для архитектуры NVIDIA Blackwell, а не 4-битная, как можно было бы предположить по названию.
Ниже приведена сводка по доступным весам и их размеру:
| Формат квантования | Размер файла (GB) | Примечание |
|---|---|---|
| NVFP4 | 12.5 | Оптимизация под NVIDIA, минимальный VRAM |
| W4A4 | 11.3 | Максимальное сжатие (веса и активации) |
| W4A8 | 12.5 | Баланс между качеством и размером |
| FP8 / FP8E5M2 | 21.0 | Высокое качество, поддержка Blackwell (mxfp8) |
| INT8 | 21.0 | Стандартная оптимизация |
| BF16 (полная точность) | 40.2 | Требует мощной видеокарты (24GB+ VRAM) |
Варианты архитектуры
В репозитории представлены две основные ветки модели: fl2va и ref2va. Версия ref2va (refined) обычно считается более стабильной и качественной для генерации. Также добавлена специальная версия int8_convrot для fl2va, которая была ранее потеряна в старых репозиториях.
Почему это важно
Запуск больших диффузионных моделей обычно требует видеокарт с 24 ГБ VRAM и более. Представленные веса, особенно в форматах NVFP4 и W4A4, позволяют запускать MiniMax-H3 на картах с 8–12 ГБ памяти, значительно расширяя круг пользователей, которые могут экспериментировать с этой архитектурой. Использование ComfyUI в связке с этими весами открывает возможности для тонкой настройки пайплайнов генерации.
Источник: Huggingface ↗
