Проблема масштабирования контекстной информации
Автоматическое распознавание речи (ASR) часто сталкивается с трудностями при работе с доменно-специфичными сущностями (имена, термины). Традиционные методы контекстного смещения (contextual biasing) ограничены размером окна контекста языковых моделей. Когда список потенциальных сущностей становится слишком большим, модель теряет способность точно идентифицировать нужные слова, особенно если они редкие.
Решение: COALA и дискриминативное пространство
Новая архитектура COALA (Contextualized ASR Leveraging Biasing Scoring) предлагает иной подход. Вместо того чтобы просто подавать список слов в модель, система проецирует латентные представления языковой модели (SLM) в специализированное дискриминативное пространство. Это позволяет количественно оценить интенсивность совпадения между аудиосегментом и кандидатом из списка. Ключевым элементом является контрастный регуляризатор, который помогает модели различать похожие сущности.
Решение проблемы multi-target collapse
Одной из главных инноваций работы является устранение эффекта «схлопывания обучения» (training collapse), который наблюдался в предыдущих исследованиях. Эта проблема возникала, когда в одном аудиопредложении встречалось несколько редких слов (multi-target utterances). COALA использует оценку баллов смещения (biasing score estimation) для стабильного обучения даже в таких сложных сценариях.
Результаты на LibriSpeech
Эксперименты проводились на бенчмарке LibriSpeech. Результаты показывают, что COALA стабильно превосходит существующие методы контекстного смещения при различных масштабах списков смещения. Это делает архитектуру особенно полезной для приложений, где требуется распознавание большого количества специфических терминов (медицина, юриспруденция, технические домены).
| Характеристика | Описание в COALA |
|---|---|
| Основной механизм | Проекция латентных представлений в дискриминативное пространство |
| Ключевая техника | Контрастный регуляризатор + оценка баллов смещения |
| Решаемая проблема | Схлопывание обучения при множественных редких словах |
| Бенчмарк | LibriSpeech |
| Статус | Принято к публикации в INTERSPEECH 2026 |
Значение для индустрии
Работа авторов (Jhih-Rong Guo, Bi-Cheng Yan, Tien-Hong Lo, Berlin Chen) демонстрирует путь к созданию более надежных голосовых помощников и систем транскрипции, способных работать с узкоспециализированной лексикой без необходимости переобучения базовых моделей под каждый новый домен.
Источник: arXiv cs.CL ↗
