Релиз модели23 августа 2026 г., 11:46 МСК🤖 Auto

MiniMax Music 3 Refiner v0.10: ИИ-реставрация музыки с метрикой 0.94

Terminus Research выпустила модель для восстановления поврежденного аудио. Модель использует латентное пространство MiniMax Music 3, достигая 11.25x ускорения на NVIDIA L40S.

Баннер новости 6327

Суть модели: не генерация, а реставрация

Новая модель MiniMax Music 3 Latent Refiner v0.10 от Terminus Research — это не текстовый генератор музыки. Это специализированный инструмент для «лечения» аудио. Модель принимает поврежденный трек (с шумом, артефактами сжатия или потерей частот) и реконструирует чистую версию, сохраняя вокал, ритм и аранжировку. Работа происходит в непрерывном латентном пространстве DAV (Diffusion Autoencoder) оригинальной модели MiniMax Music 3.

Ключевое отличие от простых фильтров: модель обучалась на задаче восстановления идентичности трека, а не на генерации нового контента. Это позволяет ей отличать реальную коррекцию от простого копирования входных данных.

Метрики и результаты

Модель демонстрирует выдающиеся результаты на тестовой выборке. Важнейшие метрики, подтверждающие качество реставрации:

  • Holdout diagonal cosine: 0.9479 — мера сходства сгенерированных латентов с чистым целевым аудио. Значение близко к 1.0 указывает на высокую точность восстановления структуры.
  • Holdout residual cosine: 0.7195 — метрика, показывающая, что модель именно исправляет ошибки, а не просто пропускает входные данные. Это отличает реставрацию от пассивного прохождения сигнала.

Для сравнения, предыдущая версия (checkpoint 2,000) показывала результаты 0.9405 и 0.7105 соответственно, что подтверждает стабильность и эффективность финального чекпоинта v0.10.

Архитектура и обучение

Модель имеет 137 миллионов параметров и обучалась на 2 262 музыкальных треках. Процесс обучения включал:

  • Деградация данных: исходные треки искусственно портились (сужение полосы пропускания, аддитивный шум, снижение битности, софт-клиппинг), чтобы модель научилась восстанавливать оригинал.
  • Три пути входа: скрытые состояния MERT (музыкальные фичи), pooled-фичи CLAP (источник звука) и латенты DAV (как поток SR3 и контекстные токены).
  • Bridge Transport: метод интерполяции между чистым и поврежденным состоянием, который позволил достичь пиковых метрик.

Производительность и системные требования

Модель оптимизирована для работы на GPU NVIDIA (рекомендуется CUDA). Тестирование проводилось на NVIDIA L40S с весами в FP32. Модель работает окнами по 30 секунд (с перекрытием 2 секунды), так как обучение велось именно на таких фрагментах.

Длительность аудио Время обработки Реальное время (x) Пиковая VRAM
30 секунд 2.67 сек 11.25x 0.92 GiB
60 секунд 8.02 сек 7.48x 1.30 GiB
120 секунд 27.68 сек 4.33x 2.06 GiB

Полный пайплайн (кодирование MERT/CLAP/DAV + сэмплирование + декодирование) для 30-секундного трека занимает 4.26 секунды, потребляя 7.15 GiB VRAM.

Как использовать

Модель доступна на Hugging Face и интегрируется через Python или ComfyUI. Для установки требуется Git LFS и последняя версия библиотеки Diffusers.

Быстрый старт через терминал:

git clone https://huggingface.co/terminusresearch/minimax-music3-latent-refiner-v0.10
cd minimax-music3-latent-refiner-v0.10
python -m pip install -e .
minimax-music3-refine input.wav refined.wav

Важные ограничения: Модель не предназначена для разделения источников, ремиксов или генерации музыки с нуля. Она также требует наличия библиотеки MERT (лицензия CC-BY-NC-4.0) для работы. Сильные повреждения, выходящие за рамки тренировочной цепи деградации, могут быть восстановлены не полностью.

Источник: Huggingface ↗