Исследования29 сентября 2026 г., 12:18 МСК🤖 Auto

Audio LLMs Know When They Can't Hear You

Исследователи из Meta AI разработали легкий предиктор надежности, который позволяет аудио-LLM самостоятельно определять, когда их транскрипция ненадежна, повышая точность распознавания на 10+ пунктов.

Баннер новости 8499

Проблема: Аудио-модели не умеют признавать ошибки

Аудио большие языковые модели (Audio LLM) позволяют пользователям взаимодействовать с ИИ голосом. Однако, если входная запись слишком искажена (шум, плохое качество микрофона), модель может неверно интерпретировать запрос пользователя и ответить на основе ошибочной транскрипции. Ключевая проблема, которую исследователи из Meta AI (Amirhosein Javadi, Richa Dixit и др.) решили в своей новой работе, заключается в том, что сами модели являются плохими судьями собственной надежности: в большинстве случаев они предсказывают, что их транскрипция будет точной, даже когда это не так.

Решение: Анализ представлений аудио-энкодера

Авторы обнаружили, что информация о надежности транскрипции сильно представлена в представлениях (representations) аудио-энкодера модели. На основе этого наблюдения они разработали легкий предиктор надежности, который работает на извлеченных представлениях замороженного аудио-энкодера и предсказывает класс надежности до генерации ответа. Этот предиктор может запросить уточнение у пользователя, если голосовой запрос считается ненадежным, позволяя надежным запросам проходить без изменения основной Audio LLM.

Результаты: Превосходство над базовыми линиями

Предложенный метод демонстрирует значительное улучшение по сравнению с существующими подходами, такими как предикторы качества речи, неопределенность генерации аудио-LLM и оценка WER, обусловленная транскриптом. Предиктор достигает высоких показателей макросреднего F1, превосходя сильные базовые линии на 10-12 пунктов.

Метрика Предложенный метод Превосходство над лучшими базовыми линиями
Macro-F1 (In-domain) 81.10% +10.33 пункта
Macro-F1 (Cross-domain) 78.09% +11.93 пункта

Переносимость между моделями

Исследователи также показали, что метки надежности могут переноситься между семействами Audio LLM. При этом производительность переноса тесно связана с выравниванием границ надежности, специфичных для каждой модели. Это открывает возможности для создания универсальных систем фильтрации шума, не требующих переобучения каждой новой аудио-LLM с нуля.

Источник: arXiv cs.AI ↗