Суть прорыва: от синтетики к реальным записям
MuScriptor — это декодер-трансформер, решающий сложную задачу автоматической музыкальной транскрипции (AMT). В отличие от многих аналогов, работающих с одиночными инструментами, MuScriptor обучен на реальных многодорожечных записях. Архитектура использует схему токенизации MT3, предсказывая параметры MIDI (высота, время, инструмент) авторегрессионно. Доступны три варианта весов: Small (103M), Medium (307M, по умолчанию) и Large (1.4B). Код распространяется по лицензии MIT, а веса — по CC BY-NC 4.0 (некоммерческое использование).
Трехэтапное обучение: почему данные важнее архитектуры
Ключевая идея команды Kyutai — улучшение качества за счет данных, а не усложнения архитектуры. Обучение проходит в три этапа:
- Pre-training (DSynth): 1.45 млн MIDI-файлов с аугментацией (сдвиг тона, темпа, рандомизация инструментов из 250+ саундфонтов).
- Fine-tuning (DReal): 170 000 реальных записей (более 11 000 часов) с выровненными аннотациями. Использовались алгоритмы динамического выравнивания времени (DTW) для синхронизации аудио и символов.
- Reinforcement Learning (DRL): 300 вручную проверенных треков. Применяется метод GRPO с наградой, суммирующей F-меры для onset, frame и offset, что заставляет модель давать более чистый результат.
Результаты бенчмарков: разрыв с базовой линией
На тестовом наборе DTest (372 трека) модель демонстрирует значительный прогресс. Особенно важна метрика Multi F1, так как она требует не только правильного нотоперевода, но и корректного определения инструмента. Добавление реальных данных (DReal) дало прирост около 20 пунктов по всем метрикам.
| Модель (этап обучения) | Onset F1 | Frame F1 | Offset F1 | Drums F1 | Multi F1 |
|---|---|---|---|---|---|
| YourMT3+ (baseline) | 32.5 | 45.5 | 17.8 | 41.4 | 21.9 |
| MuScriptor · DSynth | 34.5 | 48.9 | 16.1 | 21.0 | 16.2 |
| MuScriptor · DSynth + DReal | 54.4 | 69.3 | 42.3 | 43.3 | 41.6 |
| MuScriptor · DSynth + DReal + DRL | 60.4 | 73.3 | 49.0 | 50.2 | 48.2 |
Практическое применение и ограничения
Модуль позволяет стримить события нот напрямую или генерировать MIDI-файлы. Поддерживается условная генерация по известным инструментам (например, выделение только ударных). Модель полезна для продюсеров (извлечение бас-линий), музыковедов (анализ исторических записей) и разработчиков образовательных инструментов.
Существуют и ограничения: токенизатор не поддерживает скорость нажатия (velocity) и одновременные ноты одного инструмента. Точность onset/offset снижается на сложных стилях вроде хоров. Размер сегмента анализа — 5 секунд, что ограничивает контекст, а модель Large требует GPU для приемлемой скорости.
Источник: MarkTechPost ↗
