Исследования7 сентября 2026 г., 23:17 МСК🤖 Auto

Анатомия галлюцинаций ASR: почему Conformer-модели «сходят с ума»

Исследование arXiv:2609.04404 выявило критическую зону в архитектуре распознавания речи, где модели теряют связь с аудио. Ученые показали, что отказ от финального блока Conformer приводит к полному разрыву с реальностью, но не к красивым галлюцинация

Баннер новости 6967

Проблема «красивой лжи» в ASR

Системы автоматического распознавания речи (ASR) часто генерируют беглый, но бессмысленный текст, не имеющий отношения к произнесенному. Авторы работы Hamees Sayed, Apoorv Singh, Kumar Aman и Akshat Mandloi рассматривают это не как случайную ошибку, а как следствие провала заземления (grounding failure) — когда текстовая транскрипция перестает контролироваться аудиосигналом. Исследование посвящено пониманию механики этого сбоя.

Методология: Conformer-Large под микроскопом

Для анализа были выбраны две независимо обученные модели архитектуры Conformer-Large с разными декодерами: CTC (Connectionist Temporal Classification) и RNN-T (Recurrent Neural Network Transducer). Эксперименты проводились в условиях:

  • Деградации окружающей среды (шум, эхо).
  • Сдвига распределения между голосом спикера и фоном.

Ключевым методом стало вмешательство в архитектуру: исследователи «отключали» (bypassing) различные блоки энкодера, чтобы увидеть, на каком этапе модель теряет связь с аудио.

Ключевая находка: Финальный блок — узкое горлышко

Результаты выявили четкую границу ответственности внутри нейросети. Оказалось, что именно финальный этап энкодера является критической зоной для заземления. Если пропустить этот блок, модель теряет способность к адекватному распознаванию практически на каждом высказывании.

В этом финальном блоке происходят три важных процесса:

  1. Представления (representations) становятся более компактными.
  2. Текст становится читаемым для обученного декодера.
  3. Информация о графемах (буквах) становится явной.

Почему это важно для индустрии

Важнейший вывод исследования заключается в том, что простое отключение финального блока не приводит к «галлюцинациям» в привычном смысле (красивому, но ложному тексту). Вместо этого модель выдает искаженный или повторяющийся шум. Это означает, что финальный блок отвечает за базовое соответствие аудио тексту, а не за способность модели «выдумывать» правдоподобные фразы. Таким образом, авторы идентифицировали механическое предпосылку для галлюцинаций: это не просто ошибка декодера, а сбой на терминальном этапе энкодера, который должен был удерживать модель в рамках аудио-реальности.

Параметр Результат вмешательства Наблюдаемый эффект
Отключение финального блока Полная дивергенция Потеря связи с аудио, нечитаемый вывод
Отключение средних блоков Минимальное влияние Распознавание остается стабильным
Архитектура Conformer-Large Тестировалось на CTC и RNN-T

Эти результаты демонстрируют устойчивую зависимость терминального этапа для заземленного распознавания речи, что открывает новые пути для диагностики и исправления ошибок в современных голосовых ассистентах.

Источник: arXiv cs.CL ↗