Проблема генеративных галлюцинаций Whisper
Модель Whisper, ставшая стандартом для автоматического распознавания речи (ASR), страдает от серьезного недостатка: ее генеративный декодер склонен создавать «беглые», но бессмысленные тексты при обработке тишины или шума. Это явление, известное как галлюцинации, критично для приложений, где важна точность, а не просто наличие текста. Исследователи Maryam Abbasihafshejani и Murtuza Jadliwala из Университета штата Оклахома предложили решение, не требующее дообучения модели.
Метод: Проекция пространства галлюцинаций
Авторы разработали метод Hallucination Space Projection (HSP), который работает на этапе инференса. Суть метода заключается в вычислении компактного подпространства, ассоциированного с галлюцинациями, на основе калибровочных данных, содержащих только тишину или шум. Во время работы модели скрытые состояния декодера проецируются прочь от этого подпространства, что физически блокирует генерацию несуществующих слов.
Два режима работы и метрики
Исследователи протестировали два варианта применения проекции:
- Always-on (Всегда включено): Проекция применяется ко всем входным данным. Это дает максимальное подавление галлюцинаций, но может влиять на распознавание реальной речи.
- Gated (С вентилем): Проекция применяется только тогда, когда модель сама предполагает, что входные данные содержат мало или не содержат речи. Это обеспечивает баланс между точностью и чистотой транскрипта.
Результаты тестирования на бенчмарках, содержащих не-речевые данные, демонстрируют впечатляющие цифры:
| Метрика / Режим | Исходный уровень (Baseline) | Always-on HSP | Gated HSP |
|---|---|---|---|
| Средняя частота галлюцинаций (HR) | 31.31% | 2.44% | 3.74% |
| Относительное снижение HR | — | 92.21% | 88.05% |
| Ложное отклонение речи (FRR) на LibriSpeech | — | Информация недостаточна | 0.41% – 9.97% |
| Рост WER (Word Error Rate) на LibriSpeech | — | Информация недостаточна | +0.33 – 4.39 п.п. |
Почему это важно
Ключевое преимущество метода — отсутствие необходимости в переобучении (fine-tuning). Это означает, что разработчики могут внедрить HSP в существующие пайплайны обработки аудио «на лету», просто добавив слой проекции к активациям декодера. Метод позволяет гибко настраивать компромисс: если критична только чистота текста (например, в системах субтитрования тишины), используется режим Always-on. Если важна точность распознавания слов, режим Gated вносит минимальные изменения в WER (+0.33-4.39%), сохраняя при этом высокую надежность.
Источник: arXiv cs.AI ↗
