Суть проекта: H3 для изображений
Разработчик thaakeno выпустил ComfyUI-MiniMax-H3-Studio — специализированный набор узлов для ComfyUI, который адаптирует мультимодель MiniMax H3 (изначально созданную для аудио и видео) под задачи генерации изображений. Проект позиционируется как «единый поддерживаемый рабочий процесс», который скрывает сложность маршрутизации моделей, обработки VAE и управления референсами за удобным интерфейсом.
Важно отметить: проект находится в стадии alpha. MiniMax H3 не является специализированной моделью для изображений, поэтому некоторые функции (особенно генерация высокого разрешения) считаются экспериментальными. Официальная команда MiniMax планирует выпустить потомка H3, заточенного под изображения, но пока сообщество использует текущие решения.
Ключевые возможности и архитектура
Инструмент объединяет несколько режимов генерации в одном интерфейсе «Image Director»:
- Text-to-Image (FL2VA): Генерация только по тексту, игнорируя загруженные референсы.
- Image-to-Image (FL2VA): Использование первого изображения как основы с независимым выбором размера выхода.
- Reference Edit (REF2VA): Генерация на основе до 9 упорядоченных референсных изображений. Каждый референс можно адресовать как
@Image1...@Image9, назначая им роли (лицо, поза, стиль, освещение и т.д.).
Система автоматически маршрутизирует запросы, предотвращая ошибки (например, попытку использовать REF2VA без референсов). Поддерживается кэширование промптов, референсов и латентов.
Ускорение и профили сэмплирования
H3 Studio предлагает как нативные, так и ускоренные пути генерации. Особое внимание уделено адаптерам LightX и PDD:
| Профиль | Маршрут | Шаги | Примечания |
|---|---|---|---|
| Base Quality | FL2VA / REF2VA | 20 | Базовый уровень качества (без ускорения) |
| Base Balanced | FL2VA / REF2VA | 12 | Быстрое сравнение, баланс скорости/качества |
| LightX v1.0 FL2VA | FL2VA | 8 | Официальный полный адаптер v1.0 (основной ускоренный путь) |
| LightX v1.0 pruned | FL2VA | — | Адаптер Kijai 768p rank-31 |
| LightX ER-SDE | FL2VA / REF2VA | — | Эмпирический рецепт Kijai LightX v0.1 |
| Mamad8 PDD 600/900 | REF2VA | 4 | Только для референсов, требует контекста |
Улучшение лиц (Face Refine) и детализация
Для решения проблемы «маленьких и нечетких лиц» в широких композициях внедрен модуль Face Refine:
- После генерации кадра система находит лица с помощью YOLOv8-Face (рекомендуется) или других детекторов.
- Выделяется область лица, которая рендерится заново через H3 (FL2VA) в увеличенном масштабе.
- Результат бесшовно встраивается обратно в исходное изображение.
Поддерживается маскирование через SAM (Segment Anything Model) для более точного слияния. Режимы работы: Off, Auto (одно лицо) и Strong (множественное улучшение).
Технические ограничения и рекомендации
Разработчик предупреждает о специфике работы с H3:
- Разрешение: Прямая генерация до 8.5 MP доступна, но H3 Base не является моделью супер-разрешения. Увеличение пикселей не гарантирует детализации, но резко повышает потребление VRAM и время декодирования.
- VAE: По умолчанию используется оригинальный видео-VAE H3. Доступен экспериментальный T=1 Image VAE (от Mamad8), который легче, но может размывать текст и мелкие детали.
- Совместимость: Узлы не поддерживают ComfyUI Nodes 2.0 (интерфейс Director и Benchmark работают только в Nodes 1.0).
- Промпты: Доступна опциональная интеллектуальная подготовка промптов с помощью моделей Qwen3-VL (4B, 8B), которые анализируют референсы и улучшают запрос.
Для работы требуется установка моделей H3 (FL2VA, REF2VA) и опционально Universal Asset Downloader (UAD). Проект активно развивается, и пользователи могут ожидать появления специализированной image-модели от MiniMax в будущем.
Источник: Github ↗
