Технические характеристики и возможности
MiniMax официально запустила модель MiniMax H3 — универсальную омни-модальную систему генерации. В отличие от предыдущих версий, H3 объединяет понимание текста, изображений, видео и аудио в единый контекст. Ключевые параметры генерации:
- Разрешение: 2K (по умолчанию), поддержка 768p.
- Длительность: до 15 секунд за один проход.
- Аудио: нативный стереозвук, генерируемый совместно с видео (голос, эффекты, музыка без разделения на домены).
- Управление: точный контроль через естественный язык, включая V2V (Video-to-Video) трансфер движения и референсы.
Ценовое преимущество и архитектура
Главное преимущество H3 — экономическая эффективность благодаря новым технологиям: H3-VAE (увеличивает эффективную длину последовательности в 4 раза) и H3-Omni Transformer. Модель использует подход Contextual Omni Representation, где язык выступает мостом для объединения задач, что позволяет избегать узкоспециализированных архитектур.
| Параметр | MiniMax H3 | Основные конкуренты (Closed-source) |
|---|---|---|
| Разрешение видео | 2K (по умолчанию) | Обычно 720p-1080p |
| Стоимость (за секунду) | < 33% от цены конкурентов | Базовая ставка |
| Цена 768p H3 | < 50% от цены 720p конкурентов | — |
| Открытость весов | Да (скоро) | Закрытые модели |
Открытость экосистемы
MiniMax планирует открыть веса модели H3 в ближайшие дни, чтобы поддержать open-source сообщество и упростить кастомизацию под различное «железо». Это шаг, направленный на преодоление доминирования закрытых моделей, которые часто медленнее развиваются и имеют менее открытую экосистему.
Применение в индустрии
Модель позиционируется как готовая к продакшену для рекламы, e-commerce, дизайна UI/UX и геймдева. H3 умеет работать с комплексными промптами, например: «Используй камеру из Видео 1, пусть персонаж с Картинки 2 поет под Аудио 3», самостоятельно выстраивая логические связи между контекстом и результатом.
Источник: Minimax ↗
