Релиз модели14 августа 2026 г., 09:45 МСК🤖 Auto

MiniMax Music 3: Генерация полных треков до 5 минут с точным контролем

MiniMax представила Music 3 — гибридную модель на базе 8B LLM, способную создавать структурно целостные песни с вокалом и аранжировкой длиной до пяти минут.

Баннер новости 5776

Архитектура: Гибрид глобального и локального понимания

MiniMax Music 3 решает проблему «дрожания» и потери качества в длинных аудио-генерациях за счет уникальной гибридной архитектуры. Модель разделяет задачи на два уровня:

  • Global LLM (8B): Базируется на Qwen3-8B. Отвечает за семантическую структуру, долгосрочную когерентность темы и прогрессию аранжировки. Предсказывает первый RVQ-кодбук.
  • Local LLM (0.6B): Отвечает за акустические детали на уровне кадров, восстанавливая тонкие нюансы звука.

Вместо простого декодирования дискретных токенов, система использует Continuous Hidden-State Synthesis. Скрытые состояния обеих LLM объединяются и передаются в Flow Matching (2.4B) и Flow-VAE, что обеспечивает плавность вокальной артикуляции и текстуры инструментов.

Контроль через Structured Caption

Ключевая особенность Music 3 — возможность детального управления через промпты. Пользователь задает не просто жанр, а структурированное описание, включающее:

  • Global Metadata: жанр, BPM, тональность, эмоциональная дуга.
  • Vocal Details: тембр, пол, стиль исполнения, бэк-вокал.
  • Arrangement: эволюция инструментов по секциям, бас, перкуссия, пространственные эффекты.

Модель поддерживает теги секций ([Verse], [Chorus], [Bridge] и др.), что позволяет ей выстраивать логичную композицию от интро до аутро.

Технические характеристики и метрики

Модель генерирует аудио в формате 32 kHz, 16-bit stereo WAV. Обучение токенизатора использует 8 слоев Residual Vector Quantization (RVQ): один семантический (16,384 записей) и семь акустических (по 1,024 записей).

Параметр Значение / Описание
Максимальная длина трека До 5 минут (9,000 акустических кадров)
Размер Global LLM 8B параметров (на базе Qwen3-8B)
Размер Local LLM 0.6B параметров
Качество аудио 32 kHz, 16-bit, Stereo WAV
Требования к железу 2 CUDA GPU (GPU 0: LLM/RVQ, GPU 1: Flow Matching/Decoder)
Лимит токенов промпта 5,000 токенов

Как запустить модель

Модель доступна на Hugging Face (MiniMaxAI/MiniMax-Music3) и поддерживается через SGLang-Omni. Для запуска требуется сервер с двумя GPU.

Пример запроса через API:

curl http://127.0.0.1:8000/v1/audio/speech \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax_ttm",
    "input": "[Verse]\nMorning light filtering through the pine\n[Chorus]\nSoftly the world begins to breathe",
    "instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.",
    "response_format": "wav",
    "seed": 7,
    "max_new_tokens": 9000
  }'

Также доступен инструмент music-caption-rewriter — агент, который автоматически расширяет краткое описание в детальное Structured Caption, улучшая результат генерации.

Ограничения

На данный момент модель не поддерживает потоковую генерацию (streaming). Также важно отметить, что теги секций и описания дают вероятностный контроль, а не строгие символические гарантии: темп, тональность и инструменты могут варьироваться, хотя общая структура обычно соблюдается.

Источник: Github ↗