Релиз модели31 июля 2026 г., 13:45 МСК🤖 Auto

MiniMax H3: Видео 2K со звуком и открытые веса за копейки

MiniMax представил мультимодальную модель H3, генерирующую видео 2K с нативным стереозвуком. Модель открыта для сообщества, а её цена в 3 раза ниже конкурентов.

Баннер новости 4802

Технические характеристики и возможности

MiniMax официально запустила модель MiniMax H3 — универсальную омни-модальную систему генерации. В отличие от предыдущих версий, H3 объединяет понимание текста, изображений, видео и аудио в единый контекст. Ключевые параметры генерации:

  • Разрешение: 2K (по умолчанию), поддержка 768p.
  • Длительность: до 15 секунд за один проход.
  • Аудио: нативный стереозвук, генерируемый совместно с видео (голос, эффекты, музыка без разделения на домены).
  • Управление: точный контроль через естественный язык, включая V2V (Video-to-Video) трансфер движения и референсы.

Ценовое преимущество и архитектура

Главное преимущество H3 — экономическая эффективность благодаря новым технологиям: H3-VAE (увеличивает эффективную длину последовательности в 4 раза) и H3-Omni Transformer. Модель использует подход Contextual Omni Representation, где язык выступает мостом для объединения задач, что позволяет избегать узкоспециализированных архитектур.

Параметр MiniMax H3 Основные конкуренты (Closed-source)
Разрешение видео 2K (по умолчанию) Обычно 720p-1080p
Стоимость (за секунду) < 33% от цены конкурентов Базовая ставка
Цена 768p H3 < 50% от цены 720p конкурентов
Открытость весов Да (скоро) Закрытые модели

Открытость экосистемы

MiniMax планирует открыть веса модели H3 в ближайшие дни, чтобы поддержать open-source сообщество и упростить кастомизацию под различное «железо». Это шаг, направленный на преодоление доминирования закрытых моделей, которые часто медленнее развиваются и имеют менее открытую экосистему.

Применение в индустрии

Модель позиционируется как готовая к продакшену для рекламы, e-commerce, дизайна UI/UX и геймдева. H3 умеет работать с комплексными промптами, например: «Используй камеру из Видео 1, пусть персонаж с Картинки 2 поет под Аудио 3», самостоятельно выстраивая логические связи между контекстом и результатом.

Источник: Minimax ↗