Суть модели: не генерация, а реставрация
Новая модель MiniMax Music 3 Latent Refiner v0.10 от Terminus Research — это не текстовый генератор музыки. Это специализированный инструмент для «лечения» аудио. Модель принимает поврежденный трек (с шумом, артефактами сжатия или потерей частот) и реконструирует чистую версию, сохраняя вокал, ритм и аранжировку. Работа происходит в непрерывном латентном пространстве DAV (Diffusion Autoencoder) оригинальной модели MiniMax Music 3.
Ключевое отличие от простых фильтров: модель обучалась на задаче восстановления идентичности трека, а не на генерации нового контента. Это позволяет ей отличать реальную коррекцию от простого копирования входных данных.
Метрики и результаты
Модель демонстрирует выдающиеся результаты на тестовой выборке. Важнейшие метрики, подтверждающие качество реставрации:
- Holdout diagonal cosine: 0.9479 — мера сходства сгенерированных латентов с чистым целевым аудио. Значение близко к 1.0 указывает на высокую точность восстановления структуры.
- Holdout residual cosine: 0.7195 — метрика, показывающая, что модель именно исправляет ошибки, а не просто пропускает входные данные. Это отличает реставрацию от пассивного прохождения сигнала.
Для сравнения, предыдущая версия (checkpoint 2,000) показывала результаты 0.9405 и 0.7105 соответственно, что подтверждает стабильность и эффективность финального чекпоинта v0.10.
Архитектура и обучение
Модель имеет 137 миллионов параметров и обучалась на 2 262 музыкальных треках. Процесс обучения включал:
- Деградация данных: исходные треки искусственно портились (сужение полосы пропускания, аддитивный шум, снижение битности, софт-клиппинг), чтобы модель научилась восстанавливать оригинал.
- Три пути входа: скрытые состояния MERT (музыкальные фичи), pooled-фичи CLAP (источник звука) и латенты DAV (как поток SR3 и контекстные токены).
- Bridge Transport: метод интерполяции между чистым и поврежденным состоянием, который позволил достичь пиковых метрик.
Производительность и системные требования
Модель оптимизирована для работы на GPU NVIDIA (рекомендуется CUDA). Тестирование проводилось на NVIDIA L40S с весами в FP32. Модель работает окнами по 30 секунд (с перекрытием 2 секунды), так как обучение велось именно на таких фрагментах.
| Длительность аудио | Время обработки | Реальное время (x) | Пиковая VRAM |
|---|---|---|---|
| 30 секунд | 2.67 сек | 11.25x | 0.92 GiB |
| 60 секунд | 8.02 сек | 7.48x | 1.30 GiB |
| 120 секунд | 27.68 сек | 4.33x | 2.06 GiB |
Полный пайплайн (кодирование MERT/CLAP/DAV + сэмплирование + декодирование) для 30-секундного трека занимает 4.26 секунды, потребляя 7.15 GiB VRAM.
Как использовать
Модель доступна на Hugging Face и интегрируется через Python или ComfyUI. Для установки требуется Git LFS и последняя версия библиотеки Diffusers.
Быстрый старт через терминал:
git clone https://huggingface.co/terminusresearch/minimax-music3-latent-refiner-v0.10
cd minimax-music3-latent-refiner-v0.10
python -m pip install -e .
minimax-music3-refine input.wav refined.wav
Важные ограничения: Модель не предназначена для разделения источников, ремиксов или генерации музыки с нуля. Она также требует наличия библиотеки MERT (лицензия CC-BY-NC-4.0) для работы. Сильные повреждения, выходящие за рамки тренировочной цепи деградации, могут быть восстановлены не полностью.
Источник: Huggingface ↗
