Релиз модели17 августа 2026 г., 19:47 МСК🤖 Auto

MiniMax Music 3: 8B-модель для генерации полных треков до 5 минут

MiniMax представила открытую модель Music 3, способную создавать структурированные песни с вокалом длительностью до пяти минут. Архитектура Hybrid-LM объединяет глобальное понимание структуры и локальные акустические детали.

Баннер новости 5936

Архитектура Hybrid-LM: Глобальное и локальное

В основе MiniMax Music 3 лежит гибридная авторегрессионная архитектура, разделяющая задачи моделирования музыки на два уровня. Это позволяет избежать типичных для генеративных моделей проблем с потерей качества на длинных отрезках.

  • Global LLM (8B параметров): Базируется на Qwen3-8B. Отвечает за семантическую структуру песни, ритм и развитие темы на протяжении всего трека. Предсказывает первый RVQ-кодбук.
  • Local LLM (0.6B параметров): Отвечает за акустические детали внутри каждого кадра, восстанавливая тонкие нюансы звучания.

Вместо декодирования только дискретных токенов, система использует Continuous Hidden-State Synthesis. Скрытые состояния обеих LLM объединяются и передаются в модуль Flow Matching (2.4B) и Flow-VAE Decoder (123M), что обеспечивает плавность вокала и инструментов.

Контроль через Structured Caption

Модель принимает два типа ввода: текст песен (с тегами секций) и детальное описание музыки. Для максимального качества рекомендуется использовать Structured Caption, разбитый на три блока:

  1. Global Metadata: жанр, BPM, тональность, эмоциональная дуга.
  2. Vocal Details: тембр, пол вокалиста, гармонии, эффекты.
  3. Arrangement: эволюция инструментов по секциям, бас, перкуссия, пространственные эффекты.

Технические характеристики и метрики

Модель генерирует аудио в формате 32 kHz, 16-bit stereo WAV. Токенизация использует 8 слоев Residual Vector Quantization (RVQ): один семантический кодбук (16,384 записей) и семь акустических (по 1,024 записей).

Параметр Значение / Описание
Максимальная длина трека До 5 минут
Глобальная модель 8B параметров (на базе Qwen3-8B)
Локальная модель 0.6B параметров
Синтез звука Flow Matching (2.4B) + Flow-VAE (123M)
Формат выхода 32 kHz, 16-bit, Stereo WAV
Требования к VRAM ~22 GB (с CPU offload), возможно запуск на 8 GB с потоковой загрузкой слоев
Скорость генерации 25 аудио-фреймов в секунду

Как запустить модель

MiniMax Music 3 доступна на Hugging Face и поддерживается через SGLang-Omni, Diffusers и ComfyUI. Для работы требуется CUDA. Пример запроса через API:

curl http://127.0.0.1:8000/v1/audio/speech \
  -H 'Content-Type: application/json' \
  -d '{
  "model": "MiniMaxAI/MiniMax-Music3",
  "input": "[Verse]\nMorning light filtering through the pine...",
  "instructions": "A warm acoustic pop song...",
  "response_format": "wav"
}'

Для пользователей с ограниченными ресурсами доступна оптимизация через ComponentsManager и apply_group_offloading в библиотеке Diffusers, что позволяет запускать модель на видеокартах с 8 ГБ памяти, albeit с более медленной генерацией.

Источник: Huggingface ↗