Проблема интеграции LLM в ASR
Современные системы автоматического распознавания речи (ASR) все чаще интегрируют большие языковые модели (LLM) для улучшения семантической точности. Основные подходы включают внешнюю слияние логитов (logit fusion) или внутреннюю инициализацию с «теплым стартом» (warm initialization). Однако эффективное комбинирование этих стратегий остается малоизученной областью. Авторы работы, принятой в Findings of EMNLP 2026, предлагают новый подход, который позволяет модели использовать свою собственную базовую LLM для самодиагностики и исправления ошибок.
Метод Hybrid Search
Предложенный метод Hybrid Search основан на анализе взаимодействий между скрытыми состояниями (hidden states) ASR-модели и базовой LLM. Ключевая идея заключается в том, что даже после передачи семантических знаний через warm initialization, модель может извлекать дополнительные сигналы из своей базовой архитектуры. Метод идентифицирует токены с высокой степенью семантической зависимости и корректирует только их, избегая глобальных изменений, которые могут внести шум.
Сравнение подходов
Эксперименты показали, что целевая коррекция отдельных токнов значительно превосходит традиционные методы глобальной коррекции. Ниже приведено сравнение эффективности различных стратегий:
| Метод коррекции | Описание | Результат (относительная эффективность) |
|---|---|---|
| Rescoring | Глобальная переоценка вероятностей всей последовательности | Базовый уровень |
| Late Fusion | Позднее слияние логитов LLM и ASR | Умеренное улучшение |
| Hybrid Search (Proposed) | Селективная коррекция токенов с высокой семантической зависимостью | Значительное улучшение (SOTA) |
Почему это важно
Результаты исследования демонстрируют, что скрытые состояния LLM содержат информативные сигналы о семантической надежности каждого токена. Это позволяет создавать более надежные системы распознавания речи, которые способны к самодиагностике на этапе инференса без необходимости переобучения или изменения архитектуры модели. Метод особенно эффективен в настройках LoRA, где базовая LLM сохраняется и может быть использована как источник дополнительной семантической проверки.
Авторы и публикация
Работа выполнена группой исследователей во главе с Chan-Jan Hsu, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Hung-yi Lee и Carlos Busso. Статья принята к публикации в Findings of EMNLP 2026 и доступна на arXiv (2609.02940).
Источник: arXiv cs.CL ↗
