Исследования5 сентября 2026 г., 04:18 МСК🤖 Auto

Listen to the Latents: Самокоррекция ASR через скрытые состояния LLM

Исследователи представили метод Hybrid Search, позволяющий моделям распознавания речи (ASR) самостоятельно исправлять ошибки на этапе инференса, используя скрытые состояния базовых LLM.

Баннер новости 6824

Проблема интеграции LLM в ASR

Современные системы автоматического распознавания речи (ASR) все чаще интегрируют большие языковые модели (LLM) для улучшения семантической точности. Основные подходы включают внешнюю слияние логитов (logit fusion) или внутреннюю инициализацию с «теплым стартом» (warm initialization). Однако эффективное комбинирование этих стратегий остается малоизученной областью. Авторы работы, принятой в Findings of EMNLP 2026, предлагают новый подход, который позволяет модели использовать свою собственную базовую LLM для самодиагностики и исправления ошибок.

Метод Hybrid Search

Предложенный метод Hybrid Search основан на анализе взаимодействий между скрытыми состояниями (hidden states) ASR-модели и базовой LLM. Ключевая идея заключается в том, что даже после передачи семантических знаний через warm initialization, модель может извлекать дополнительные сигналы из своей базовой архитектуры. Метод идентифицирует токены с высокой степенью семантической зависимости и корректирует только их, избегая глобальных изменений, которые могут внести шум.

Сравнение подходов

Эксперименты показали, что целевая коррекция отдельных токнов значительно превосходит традиционные методы глобальной коррекции. Ниже приведено сравнение эффективности различных стратегий:

Метод коррекции Описание Результат (относительная эффективность)
Rescoring Глобальная переоценка вероятностей всей последовательности Базовый уровень
Late Fusion Позднее слияние логитов LLM и ASR Умеренное улучшение
Hybrid Search (Proposed) Селективная коррекция токенов с высокой семантической зависимостью Значительное улучшение (SOTA)

Почему это важно

Результаты исследования демонстрируют, что скрытые состояния LLM содержат информативные сигналы о семантической надежности каждого токена. Это позволяет создавать более надежные системы распознавания речи, которые способны к самодиагностике на этапе инференса без необходимости переобучения или изменения архитектуры модели. Метод особенно эффективен в настройках LoRA, где базовая LLM сохраняется и может быть использована как источник дополнительной семантической проверки.

Авторы и публикация

Работа выполнена группой исследователей во главе с Chan-Jan Hsu, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Hung-yi Lee и Carlos Busso. Статья принята к публикации в Findings of EMNLP 2026 и доступна на arXiv (2609.02940).

Источник: arXiv cs.CL ↗