Релиз модели5 августа 2026 г., 21:46 МСК🤖 Auto

MiniMax H3: Открытый видео-модель с нативным звуком и 2K разрешением

Компания MiniMax выпустила веса своей мультимодальной модели H3 для локального запуска в ComfyUI. Модель генерирует видео до 2K с синхронизированным стереозвуком, музыкой и диалогами в одном проходе.

Баннер новости 5151

Революция в локальной генерации видео

Китайская лаборатория MiniMax сделала важный шаг для сообщества open-source, опубликовав веса своей универсальной модели MiniMax H3. В отличие от предыдущих решений, где звук добавлялся постфактум, H3 генерирует видео и аудио (диалоги, звуковые эффекты, музыку) совместно в одном forward-проходе. Это обеспечивает идеальную синхронизацию и естественность звучания.

Модель поддерживает работу с текстом, изображениями, видео и аудио в едином контексте. Разрешение вывода достигает 2K (нативный холст 768px по короткой стороне, до 1344x768), частота кадров — 24 fps, длительность клипа — около 15 секунд.

Три режима генерации в ComfyUI

Для работы с моделью в ComfyUI (версия 0.30.0+) подготовлены готовые шаблоны. Модель поддерживает три основных сценария использования:

  • Text-to-Video (T2V): Генерация видео исключительно по текстовому промпту.
  • Image-to-Video (I2V): Анимация входного изображения с возможностью контроля первого и последнего кадров.
  • Reference-to-Video (R2V): Генерация с привязкой к референсам. Можно зафиксировать идентичность персонажа, стиль, движение камеры или голос из загруженных медиафайлов.

Технические характеристики и требования

Модель использует сложную архитектуру, включающую текстовый энкодер на базе Qwen3VL и специализированные VAE для видео и аудио. Ниже приведена структура необходимых файлов для локального запуска:

Компонент Название файла Путь в ComfyUI
Diffusion Model (T2V/I2V) minimax_h3_fl2va_pruned_int8_convrot.safetensors models/diffusion_models/
Diffusion Model (R2V) minimax_h3_ref2va_pruned_int8_convrot.safetensors models/diffusion_models/
Text Encoder qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors models/text_encoders/
Video VAE minimax_h3_video_vae_fp16.safetensors models/vae/
Audio VAE minimax_h3_audio_vae_fp32.safetensors models/vae/

Нюансы настройки и промптинга

Для получения качественного результата важно учитывать технические ограничения модели. Разрешение рассчитывается через ноду Resolution Selector, где рекомендуется ставить множитель округления равным 32. Для полного качества при соотношении сторон 16:9 целевое количество мегапикселей должно быть около 1.0.

Длительность генерации привязана к сетке модели: 17 кадров + 5 на блок при 24 fps. В промптах рекомендуется описывать сцену целиком, затем разбивать её на тайминги, явно указывая движения камеры и тип звука (диалог, SFX, музыка). Для режима R2V можно использовать до 9 изображений-референсов и 3 видео, привязывая их к конкретным аспектам генерации через теги.

Почему это важно

Открытие весов MiniMax H3 позволяет энтузиастам и разработчикам запускать один из самых продвинутых видео-генераторов локально, без цензуры и ограничений облачных сервисов. Интеграция звука в процесс генерации решает одну из главных проблем текущих видео-моделей — рассинхронизацию и отсутствие атмосферного саунд-дизайна. Это делает H3 мощным инструментом для создания готовых видеороликов «под ключ» прямо на домашнем ПК.

Источник: Comfy ↗