Проблема: Аудио-модели не умеют признавать ошибки
Аудио большие языковые модели (Audio LLM) позволяют пользователям взаимодействовать с ИИ голосом. Однако, если входная запись слишком искажена (шум, плохое качество микрофона), модель может неверно интерпретировать запрос пользователя и ответить на основе ошибочной транскрипции. Ключевая проблема, которую исследователи из Meta AI (Amirhosein Javadi, Richa Dixit и др.) решили в своей новой работе, заключается в том, что сами модели являются плохими судьями собственной надежности: в большинстве случаев они предсказывают, что их транскрипция будет точной, даже когда это не так.
Решение: Анализ представлений аудио-энкодера
Авторы обнаружили, что информация о надежности транскрипции сильно представлена в представлениях (representations) аудио-энкодера модели. На основе этого наблюдения они разработали легкий предиктор надежности, который работает на извлеченных представлениях замороженного аудио-энкодера и предсказывает класс надежности до генерации ответа. Этот предиктор может запросить уточнение у пользователя, если голосовой запрос считается ненадежным, позволяя надежным запросам проходить без изменения основной Audio LLM.
Результаты: Превосходство над базовыми линиями
Предложенный метод демонстрирует значительное улучшение по сравнению с существующими подходами, такими как предикторы качества речи, неопределенность генерации аудио-LLM и оценка WER, обусловленная транскриптом. Предиктор достигает высоких показателей макросреднего F1, превосходя сильные базовые линии на 10-12 пунктов.
| Метрика | Предложенный метод | Превосходство над лучшими базовыми линиями |
|---|---|---|
| Macro-F1 (In-domain) | 81.10% | +10.33 пункта |
| Macro-F1 (Cross-domain) | 78.09% | +11.93 пункта |
Переносимость между моделями
Исследователи также показали, что метки надежности могут переноситься между семействами Audio LLM. При этом производительность переноса тесно связана с выравниванием границ надежности, специфичных для каждой модели. Это открывает возможности для создания универсальных систем фильтрации шума, не требующих переобучения каждой новой аудио-LLM с нуля.
Источник: arXiv cs.AI ↗
