Проблема «красивой лжи» в ASR
Системы автоматического распознавания речи (ASR) часто генерируют беглый, но бессмысленный текст, не имеющий отношения к произнесенному. Авторы работы Hamees Sayed, Apoorv Singh, Kumar Aman и Akshat Mandloi рассматривают это не как случайную ошибку, а как следствие провала заземления (grounding failure) — когда текстовая транскрипция перестает контролироваться аудиосигналом. Исследование посвящено пониманию механики этого сбоя.
Методология: Conformer-Large под микроскопом
Для анализа были выбраны две независимо обученные модели архитектуры Conformer-Large с разными декодерами: CTC (Connectionist Temporal Classification) и RNN-T (Recurrent Neural Network Transducer). Эксперименты проводились в условиях:
- Деградации окружающей среды (шум, эхо).
- Сдвига распределения между голосом спикера и фоном.
Ключевым методом стало вмешательство в архитектуру: исследователи «отключали» (bypassing) различные блоки энкодера, чтобы увидеть, на каком этапе модель теряет связь с аудио.
Ключевая находка: Финальный блок — узкое горлышко
Результаты выявили четкую границу ответственности внутри нейросети. Оказалось, что именно финальный этап энкодера является критической зоной для заземления. Если пропустить этот блок, модель теряет способность к адекватному распознаванию практически на каждом высказывании.
В этом финальном блоке происходят три важных процесса:
- Представления (representations) становятся более компактными.
- Текст становится читаемым для обученного декодера.
- Информация о графемах (буквах) становится явной.
Почему это важно для индустрии
Важнейший вывод исследования заключается в том, что простое отключение финального блока не приводит к «галлюцинациям» в привычном смысле (красивому, но ложному тексту). Вместо этого модель выдает искаженный или повторяющийся шум. Это означает, что финальный блок отвечает за базовое соответствие аудио тексту, а не за способность модели «выдумывать» правдоподобные фразы. Таким образом, авторы идентифицировали механическое предпосылку для галлюцинаций: это не просто ошибка декодера, а сбой на терминальном этапе энкодера, который должен был удерживать модель в рамках аудио-реальности.
| Параметр | Результат вмешательства | Наблюдаемый эффект |
|---|---|---|
| Отключение финального блока | Полная дивергенция | Потеря связи с аудио, нечитаемый вывод |
| Отключение средних блоков | Минимальное влияние | Распознавание остается стабильным |
| Архитектура | Conformer-Large | Тестировалось на CTC и RNN-T |
Эти результаты демонстрируют устойчивую зависимость терминального этапа для заземленного распознавания речи, что открывает новые пути для диагностики и исправления ошибок в современных голосовых ассистентах.
Источник: arXiv cs.CL ↗
