Архитектура Hybrid-LM: Глобальное и локальное
В основе MiniMax Music 3 лежит гибридная авторегрессионная архитектура, разделяющая задачи моделирования музыки на два уровня. Это позволяет избежать типичных для генеративных моделей проблем с потерей качества на длинных отрезках.
- Global LLM (8B параметров): Базируется на Qwen3-8B. Отвечает за семантическую структуру песни, ритм и развитие темы на протяжении всего трека. Предсказывает первый RVQ-кодбук.
- Local LLM (0.6B параметров): Отвечает за акустические детали внутри каждого кадра, восстанавливая тонкие нюансы звучания.
Вместо декодирования только дискретных токенов, система использует Continuous Hidden-State Synthesis. Скрытые состояния обеих LLM объединяются и передаются в модуль Flow Matching (2.4B) и Flow-VAE Decoder (123M), что обеспечивает плавность вокала и инструментов.
Контроль через Structured Caption
Модель принимает два типа ввода: текст песен (с тегами секций) и детальное описание музыки. Для максимального качества рекомендуется использовать Structured Caption, разбитый на три блока:
- Global Metadata: жанр, BPM, тональность, эмоциональная дуга.
- Vocal Details: тембр, пол вокалиста, гармонии, эффекты.
- Arrangement: эволюция инструментов по секциям, бас, перкуссия, пространственные эффекты.
Технические характеристики и метрики
Модель генерирует аудио в формате 32 kHz, 16-bit stereo WAV. Токенизация использует 8 слоев Residual Vector Quantization (RVQ): один семантический кодбук (16,384 записей) и семь акустических (по 1,024 записей).
| Параметр | Значение / Описание |
|---|---|
| Максимальная длина трека | До 5 минут |
| Глобальная модель | 8B параметров (на базе Qwen3-8B) |
| Локальная модель | 0.6B параметров |
| Синтез звука | Flow Matching (2.4B) + Flow-VAE (123M) |
| Формат выхода | 32 kHz, 16-bit, Stereo WAV |
| Требования к VRAM | ~22 GB (с CPU offload), возможно запуск на 8 GB с потоковой загрузкой слоев |
| Скорость генерации | 25 аудио-фреймов в секунду |
Как запустить модель
MiniMax Music 3 доступна на Hugging Face и поддерживается через SGLang-Omni, Diffusers и ComfyUI. Для работы требуется CUDA. Пример запроса через API:
curl http://127.0.0.1:8000/v1/audio/speech \
-H 'Content-Type: application/json' \
-d '{
"model": "MiniMaxAI/MiniMax-Music3",
"input": "[Verse]\nMorning light filtering through the pine...",
"instructions": "A warm acoustic pop song...",
"response_format": "wav"
}'
Для пользователей с ограниченными ресурсами доступна оптимизация через ComponentsManager и apply_group_offloading в библиотеке Diffusers, что позволяет запускать модель на видеокартах с 8 ГБ памяти, albeit с более медленной генерацией.
Источник: Huggingface ↗
