Революция в локальной генерации видео
Китайская лаборатория MiniMax сделала важный шаг для сообщества open-source, опубликовав веса своей универсальной модели MiniMax H3. В отличие от предыдущих решений, где звук добавлялся постфактум, H3 генерирует видео и аудио (диалоги, звуковые эффекты, музыку) совместно в одном forward-проходе. Это обеспечивает идеальную синхронизацию и естественность звучания.
Модель поддерживает работу с текстом, изображениями, видео и аудио в едином контексте. Разрешение вывода достигает 2K (нативный холст 768px по короткой стороне, до 1344x768), частота кадров — 24 fps, длительность клипа — около 15 секунд.
Три режима генерации в ComfyUI
Для работы с моделью в ComfyUI (версия 0.30.0+) подготовлены готовые шаблоны. Модель поддерживает три основных сценария использования:
- Text-to-Video (T2V): Генерация видео исключительно по текстовому промпту.
- Image-to-Video (I2V): Анимация входного изображения с возможностью контроля первого и последнего кадров.
- Reference-to-Video (R2V): Генерация с привязкой к референсам. Можно зафиксировать идентичность персонажа, стиль, движение камеры или голос из загруженных медиафайлов.
Технические характеристики и требования
Модель использует сложную архитектуру, включающую текстовый энкодер на базе Qwen3VL и специализированные VAE для видео и аудио. Ниже приведена структура необходимых файлов для локального запуска:
| Компонент | Название файла | Путь в ComfyUI |
|---|---|---|
| Diffusion Model (T2V/I2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Diffusion Model (R2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Text Encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| Video VAE | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| Audio VAE | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
Нюансы настройки и промптинга
Для получения качественного результата важно учитывать технические ограничения модели. Разрешение рассчитывается через ноду Resolution Selector, где рекомендуется ставить множитель округления равным 32. Для полного качества при соотношении сторон 16:9 целевое количество мегапикселей должно быть около 1.0.
Длительность генерации привязана к сетке модели: 17 кадров + 5 на блок при 24 fps. В промптах рекомендуется описывать сцену целиком, затем разбивать её на тайминги, явно указывая движения камеры и тип звука (диалог, SFX, музыка). Для режима R2V можно использовать до 9 изображений-референсов и 3 видео, привязывая их к конкретным аспектам генерации через теги.
Почему это важно
Открытие весов MiniMax H3 позволяет энтузиастам и разработчикам запускать один из самых продвинутых видео-генераторов локально, без цензуры и ограничений облачных сервисов. Интеграция звука в процесс генерации решает одну из главных проблем текущих видео-моделей — рассинхронизацию и отсутствие атмосферного саунд-дизайна. Это делает H3 мощным инструментом для создания готовых видеороликов «под ключ» прямо на домашнем ПК.
Источник: Comfy ↗
