Релиз модели27 сентября 2026 г., 15:46 МСК🤖 Auto

MERT-v2-FullSong: Аудио-генерация уровня Suno v5 и агентная правка

Модель MERT-v2-FullSong объединяет символьное и аудиогенерацию на передовом уровне качества, поддерживая создание каверов и агентное редактирование музыки.

Баннер новости 8372

Новый стандарт качества в генерации музыки

Платформа Huggingface представила модель MERT-v2-FullSong, которая позиционируется как решение, объединяющее символьное (нотное) и аудиогенерацию. По заявленным метрикам, качество сгенерированного контента сопоставимо с флагманскими коммерческими решениями, такими как Suno v5. Это открывает новые возможности для разработчиков, стремящихся к созданию высокодетализированных музыкальных произведений без потери качества.

Ключевые компоненты архитектуры

В основе модели лежит комплексный подход, включающий несколько ключевых технологий:

  • MERT2: улучшенная модель энкодера для извлечения музыкальных признаков.
  • SheetSage2: продвинутый инструмент для работы с нотными записями и символьным представлением.
  • VAEs (Variational Autoencoders): вариационные автоэнкодеры для эффективного сжатия и генерации аудиоданных.

Функциональные возможности: каверы и агентное редактирование

Модель поддерживает не только генерацию с нуля, но и сложные сценарии использования. Среди них — создание кавер-версий существующих треков и агентное редактирование (agentic editing). Это означает, что пользователь может взаимодействовать с ИИ-агентом для точечной правки аранжировки, инструментовки или структуры композиции, что значительно упрощает процесс пост-продакшена.

Оценка качества: WildSongBench

Для объективной оценки производительности используется бенчмарк WildSongBench. Он позволяет сравнивать результаты генерации в реальных условиях, учитывая разнообразие жанров и стилей. Обновленная версия модели демонстрирует стабильно высокие показатели по сравнению с предыдущими итерациями и конкурентами.

Компонент/Технология Роль в модели MERT-v2-FullSong
MERT2 Извлечение музыкальных признаков высокого уровня
SheetSage2 Работа с символьным представлением (нотами)
VAEs Генерация и сжатие аудиосигнала
WildSongBench Бенчмарк для оценки качества генерации

Актуальность и обновления

Модель была обновлена 18 дней назад и имеет 14 загрузок/репозиториев, связанных с ней. Это указывает на растущий интерес сообщества к инструментам, способным конкурировать с коммерческими лидерами рынка генеративной музыки.

Источник: Huggingface ↗