Архитектура: Гибрид глобального и локального понимания
MiniMax Music 3 решает проблему «дрожания» и потери качества в длинных аудио-генерациях за счет уникальной гибридной архитектуры. Модель разделяет задачи на два уровня:
- Global LLM (8B): Базируется на Qwen3-8B. Отвечает за семантическую структуру, долгосрочную когерентность темы и прогрессию аранжировки. Предсказывает первый RVQ-кодбук.
- Local LLM (0.6B): Отвечает за акустические детали на уровне кадров, восстанавливая тонкие нюансы звука.
Вместо простого декодирования дискретных токенов, система использует Continuous Hidden-State Synthesis. Скрытые состояния обеих LLM объединяются и передаются в Flow Matching (2.4B) и Flow-VAE, что обеспечивает плавность вокальной артикуляции и текстуры инструментов.
Контроль через Structured Caption
Ключевая особенность Music 3 — возможность детального управления через промпты. Пользователь задает не просто жанр, а структурированное описание, включающее:
- Global Metadata: жанр, BPM, тональность, эмоциональная дуга.
- Vocal Details: тембр, пол, стиль исполнения, бэк-вокал.
- Arrangement: эволюция инструментов по секциям, бас, перкуссия, пространственные эффекты.
Модель поддерживает теги секций ([Verse], [Chorus], [Bridge] и др.), что позволяет ей выстраивать логичную композицию от интро до аутро.
Технические характеристики и метрики
Модель генерирует аудио в формате 32 kHz, 16-bit stereo WAV. Обучение токенизатора использует 8 слоев Residual Vector Quantization (RVQ): один семантический (16,384 записей) и семь акустических (по 1,024 записей).
| Параметр | Значение / Описание |
|---|---|
| Максимальная длина трека | До 5 минут (9,000 акустических кадров) |
| Размер Global LLM | 8B параметров (на базе Qwen3-8B) |
| Размер Local LLM | 0.6B параметров |
| Качество аудио | 32 kHz, 16-bit, Stereo WAV |
| Требования к железу | 2 CUDA GPU (GPU 0: LLM/RVQ, GPU 1: Flow Matching/Decoder) |
| Лимит токенов промпта | 5,000 токенов |
Как запустить модель
Модель доступна на Hugging Face (MiniMaxAI/MiniMax-Music3) и поддерживается через SGLang-Omni. Для запуска требуется сервер с двумя GPU.
Пример запроса через API:
curl http://127.0.0.1:8000/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{
"model": "minimax_ttm",
"input": "[Verse]\nMorning light filtering through the pine\n[Chorus]\nSoftly the world begins to breathe",
"instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.",
"response_format": "wav",
"seed": 7,
"max_new_tokens": 9000
}'
Также доступен инструмент music-caption-rewriter — агент, который автоматически расширяет краткое описание в детальное Structured Caption, улучшая результат генерации.
Ограничения
На данный момент модель не поддерживает потоковую генерацию (streaming). Также важно отметить, что теги секций и описания дают вероятностный контроль, а не строгие символические гарантии: темп, тональность и инструменты могут варьироваться, хотя общая структура обычно соблюдается.
Источник: Github ↗
