Главная/Блог/Гайд/MuScriptor: Революция в транскрипции…
Гайд10 мин чтения · 11 июля 2026 г.

MuScriptor: Революция в транскрипции музыки с помощью AI

Kyutai представила MuScriptor — первую открытую модель для точной многоинструментальной транскрипции аудио в MIDI. Разбираем архитектуру, данные и практическое применение.

MuScriptor: Революция в транскрипции музыки с помощью AI

Автоматическая музыкальная транскрипция (AMT) — это «Святой Грааль» для многих аудиоинженеров, продюсеров и исследователей. Идея проста: взять аудиозапись и получить из неё точный MIDI-файл, где каждая нота, каждый инструмент и каждый ритмический рисунок зафиксированы цифровыми символами. Однако на практике это оказалось куда сложнее, чем казалось. Если с транскрипцией сольного инструмента (например, фортепиано или вокала) современные нейросети справляются уже достаточно хорошо, то работа с полным миксом, где одновременно звучат десятки инструментов, остаётся крайне сложной задачей. Шумы, наложение частот, сложная аранжировка — всё это создаёт «кашу», из которой трудно извлечь чистые сигналы.

Команда Kyutai в сотрудничестве с Mirelo решила закрыть этот пробел. Они выпустили MuScriptor — модель с открытыми весами, основанную на архитектуре декодера-трансформера, специально разработанную для многоинструментальной транскрипции. В отличие от предыдущих решений, MuScriptor обучалась на реальных многоинструментальных записях, охватывающих множество жанров, что позволяет ей понимать контекст взаимодействия инструментов в миксе. Это не просто ещё один алгоритм; это шаг к тому, чтобы сделать процесс оцифровки музыки доступным, точным и доступным для широкой аудитории.

Визуализация интерфейса или концепции работы MuScriptor.
Визуализация интерфейса или концепции работы MuScriptor.

01Что такое MuScriptor и как она работает?

В основе MuScriptor лежит концепция, которая в последние годы захватила мир искусственного интеллекта: превращение задачи в задачу языкового моделирования. МуScriptor — это decoder-only Transformer (трансформер-декодер). Её работа начинается с того, что она считывает мел-спектрограмму короткого сегмента аудио. Затем, используя авторегрессионный подход, она предсказывает токены, похожие на MIDI, которые кодируют высоту тона (pitch), время (timing) и инструмент (instrument).

Ключевым моментом здесь является использование схемы токенизации MT3. Вместо того чтобы пытаться угадать параметры напрямую, модель генерирует последовательность токенов, подобно тому, как большие языковые модели генерируют текст. Это позволяет ей учитывать долгосрочные зависимости в музыке: если в начале такта звучит бас, модель «ожидает» определённой ритмической структуры в конце такта. Такой подход обеспечивает более целостное понимание музыкальной фразы, а не просто набор разрозненных нот.

При выпуске проекта команда предоставила три варианта весов модели на платформе Hugging Face, чтобы удовлетворить разные потребности в вычислительных ресурсах и точности:

  • Small (малая): 103 миллиона параметров. Идеальна для быстрых прототипов и устройств с ограниченными ресурсами.
  • Medium (средняя): 307 миллионов параметров. Это вариант по умолчанию, предлагающий оптимальный баланс между скоростью и точностью.
  • Large (большая): 1.4 миллиарда параметров. Максимальная точность, требующая значительных вычислительных мощностей.

Важно отметить лицензирование: код инференса (выполнения модели) распространяется под лицензией MIT, что позволяет свободно использовать его в коммерческих продуктах. Однако сами веса модели защищены лицензией CC BY-NC 4.0 (Creative Commons Attribution-NonCommercial), что означает запрет на коммерческое использование без отдельного соглашения. Это стандартная практика для исследовательских проектов, стремящихся сохранить научную открытость, но защитить интересы разработчиков.

02Трёхэтапный конвейер обучения: Секрет успеха

Главная инновация MuScriptor заключается не в архитектуре, которая, по сути, является стандартным трансформером, а в данных и процессе их обработки. Обучение модели прошло через три последовательных этапа, каждый из которых строился на результатах предыдущего.

1. Предобучение на синтетических данных (DSynth)

Первый этап использовал набор данных DSynth, состоящий примерно из 1.45 миллиона MIDI-файлов. Но просто загрузить MIDI-файлы недостаточно — модели нужно «услышать» звук. Поэтому команда разработала конвейер, который в реальном времени синтезировал аудио из MIDI во время обучения. Это позволило создать практически бесконечное разнообразие данных.

Для усиления разнообразия применялись различные аугментации: сдвиг тональности, изменение темпа, регулировка силы удара (velocity) и случайная замена инструментов. Используя более 250 звуковых шрифтов (soundfonts) и случайное расстройку инструментов, модель научилась распознавать ноты в самых разных акустических условиях. Этот этап дал модели базовое понимание того, как ноты выглядят в спектрограмме.

2. Дообучение на реальных записях (DReal)

Синтетические данные хороши для обучения базовым паттернам, но они не могут полностью воспроизвести сложность реального мира. Поэтому второй этап использовал внутренний набор данных DReal, состоящий из 170 000 реальных записей. Вместе они составляют более 11 000 часов аудио с выровненными аннотациями нот.

MuScriptor: Революция в транскрипции музыки с помощью AI

Самая сложная часть этого этапа — получение точных выравниваний. Большинство из них были получены с помощью алгоритмов аудио-символической синхронизации, использующих интерполяцию и динамическое программирование временного искажения (Dynamic Time Warping). Плохие пары (где синхронизация была неточной) отфильтровывались на основе расстояния искажения и максимального фактора временного растяжения. Именно этот этап, по словам разработчиков, дал наибольший прирост в точности, так как модель научилась работать с «грязными», реальными звуками.

3. Обучение с подкреплением (DRL)

Финальный этап был посвящён тонкой настройке. Использовался набор DRL, состоящий из 300 треков, вручную проверенных экспертами. Команда применила метод, похожий на GRPO (Group Relative Policy Optimization), который сочетает алгоритм REINFORCE с нормализацией преимущества относительно группы.

Функция вознаграждения (reward) суммировала три показателя F-меры: для начала ноты (onset), удержания (frame) и окончания (offset). Это заставило модель «понять», что важно не просто угадать наличие ноты, но и точно определить её границы во времени. В результате модель начала отдавать предпочтение более чистым и точным транскрипциям, уменьшая количество ложных срабатываний.

💡
Почему данные важнее архитектуры? В современных AI-моделях качество данных часто важнее сложности нейросети. MuScriptor показывает, что даже стандартный трансформер может достичь выдающихся результатов, если его накормить правильными, хорошо размеченными и разнообразными данными. Синтетические данные дали базу, реальные — научили понимать контекст, а RL — отточил детали.

03Результаты тестирования: Цифры говорят сами за себя

Для оценки производительности команда использовала набор данных DTest, состоящий из 372 отложенных треков с точными аннотациями. Они применяли метрики из библиотеки mir_eval, где Multi F1 является самым строгим показателем, так как требует не только правильного определения ноты, но и правильного указания инструмента.

Ниже приведена таблица, показывающая прогресс модели на каждом этапе обучения по сравнению с базовой линией YourMT3+ (используя большую модель ~1.3B параметров):

Модель (DTest) Onset F1 Frame F1 Offset F1 Drums F1 Multi F1
YourMT3+ (baseline) 32.5 45.5 17.8 41.4 21.9
MuScriptor · DSynth 34.5 48.9 16.1 21.0 16.2
MuScriptor · DSynth + DReal 54.4 69.3 42.3 43.3 41.6
MuScriptor · DSynth + DReal + DRL 60.4 73.3 49.0 50.2 48.2

Как видно из таблицы, каждый этап значительно улучшает результаты. Обучение только на синтетических данных (DSynth) даёт конкурентоспособный результат по Frame F1, но слабые показатели по Onset и Multi. Добавление реальных данных (DReal) поднимает все метрики примерно на 20 пунктов. Финальный этап с обучением с подкреплением (DRL) дополнительно снижает количество ложных отрицаний и делает начало нот более точным.

Кросс-доменные тесты также подтверждают эффективность. Например, на наборе данных Dagstuhl ChoirSet (хоры) показатель Frame F1 вырос с 51.0 до 80.7. Однако стоит отметить, что на сложных стилях, таких как хоровая музыка, точность определения начала и окончания нот (Onset/Offset) остаётся ниже, что связано с особенностями звучания голосов и инструментов в таких ансамблях.

⚠️
Важно о лицензиях. Если вы планируете использовать MuScriptor в коммерческом продукте (например, в SaaS-сервисе для музыкантов), вам необходимо связаться с Kyutai для получения коммерческой лицензии. Веса модели распространяются под CC BY-NC 4.0, что запрещает коммерческое использование. Код инференса (MIT) позволяет вам использовать библиотеку, но не сами веса для заработка.

04Как запустить MuScriptor: Практическое руководство

Одной из сильных сторон проекта является простота интеграции. Установка занимает одну команду, а инференс позволяет потоково получать события нот напрямую.

terminalpython
# pip install muscriptor   (или: uv add muscriptor)
from pathlib import Path
from muscriptor import TranscriptionModel

# Загружаем вариант "medium" (также доступны "small" / "large")
model = TranscriptionModel.load_model()

# Потоковая передача событий нот; опционально можно указать известные инструменты
for event in model.transcribe("audio.wav", instruments=["acoustic_piano", "drums"]):
    print(event)  # NoteStartEvent / NoteEndEvent / ProgressEvent

# Или сразу записать MIDI-файл
Path("out.mid").write_bytes(model.transcribe_to_midi("audio.wav"))

Для выпущенных моделей рекомендуется держать параметр cfg_coef равным 1, так как модели уже прошли постобучение с подкреплением. Кроме того, команда предоставила удобный способ запуска через браузер: команда uvx muscriptor serve запускает веб-интерфейс с живой пианинной ролью (piano roll), где можно в реальном времени видеть транскрибируемый аудиофайл.

MuScriptor: Революция в транскрипции музыки с помощью AI

05Применение на практике: Кто выиграет от MuScriptor?

Поскольку выходным форматом является стандартный MIDI, открываются широкие возможности для различных сценариев использования:

  • Продюсеры: Могут извлечь MIDI-баслайн из сложного микса, чтобы затем переиграть его в своей DAW (Digital Audio Workstation) или использовать как основу для ремикса.
  • Музыковеды: Могут конвертировать исторические записи в редактируемые нотные партитуры для анализа, что ранее требовало часов ручной работы.
  • Исследователи MIR (Music Information Retrieval): Могут использовать транскрипции как входные данные для систем распознавания аккордов или тональности.
  • Педагоги: Могут создавать инструменты для практики, показывающие живую пианинную роль во время воспроизведения записи, помогая студентам учиться на слух.
  • Разработчики: Могут транскрибировать только ударные, передав условие инструмента (instrument conditioning), что полезно для создания ритм-секций или анализа ритма.

06Сильные и слабые стороны

Несмотря на впечатляющие результаты, у модели есть свои ограничения, о которых нужно знать перед внедрением.

Сильные стороны:

  • Обучена на 170 000 реальных записей, охватывающих жанры от классики до хэви-метала.
  • Открытые веса и код инференса с лицензией MIT, доступные в трёх вариантах размера.
  • Показатель Multi F1 48.2 против 21.9 у базовой линии YourMT3+ на наборе DTest.
  • Условная транскрипция по инструментам настраивает вывод и стабилизирует предсказания между сегментами.
  • Потоковый API издает события нот и MIDI, а также предоставляет веб-интерфейс в браузере.

Слабые стороны:

  • Веса имеют лицензию CC BY-NC 4.0, что ограничивает коммерческое развертывание.
  • Токенизатор не учитывает силу удара (velocity) и не может представлять накладывающиеся ноты одной высоты и одного инструмента.
  • Точность начала и окончания нот (Onset/Offset) остается ниже на хоровых и подобных стилях.
  • Большая модель требует GPU для практической скорости работы.
  • Размер сегмента в 5 секунд ограничивает контекст длинных музыкальных фраз и скорость инференса.
📌
Факт для разработчиков. Ограничение в 5 секунд на сегмент означает, что модель работает «окнами». Для длинных треков это может привести к потере глобального контекста. Однако это также позволяет обрабатывать аудио потоково, не загружая весь файл в память, что критично для облачных сервисов.

07Что это значит на практике

Выпуск MuScriptor знаменует собой важный поворотный момент в области автоматической музыкальной транскрипции. До сих пор большинство решений либо были закрытыми коммерческими продуктами, либо демонстрировали низкую точность на сложных многоинструментальных миксах. MuScriptor демонстрирует, что подход «данные решают всё» работает: комбинация синтетических данных для базового обучения, реальных записей для понимания контекста и обучения с подкреплением для точности границ нот позволяет достичь качества, близкого к человеческому в ряде сценариев.

Для российского пользователя или разработчика это открывает новые возможности. Несмотря на лицензионные ограничения на коммерческое использование весов, открытый код инференса позволяет интегрировать модель в собственные исследовательские проекты, образовательные платформы или внутренние инструменты анализа. Возможность локального запуска (при наличии GPU) и потоковой обработки делает её привлекательной для создания сервисов, не зависящих от зарубежных облачных API.

Однако важно помнить о текущих ограничениях: проблема с хоровой музыкой, отсутствие информации о силе удара и необходимость GPU для больших моделей. Тем не менее, для задач, где важна точность определения нот и инструментов в рок-, поп- или джазовых миксах, MuScriptor является одним из лучших открытых решений на сегодняшний день. Следующим шагом для сообщества станет адаптация этой модели для работы с более длинными контекстами и, возможно, создание коммерческих версий с расширенными возможностями.

Вы можете ознакомиться с подробной статьей, репозиторием на GitHub и весами модели на Hugging Face. Если вы работаете в области обработки звука или музыки, MuScriptor определенно стоит добавить в свой стек инструментов для экспериментов.

Источник: MarkTechPost ↗