Исследования7 сентября 2026 г., 16:18 МСК🤖 Auto

Whisper без переобучения: как снизить галлюцинации на 92%

Исследователи представили метод Hallucination Space Projection, который устраняет ложные транскрипты в Whisper во время инференса, снижая уровень ошибок на 92% без изменения весов модели.

Баннер новости 6941

Проблема генеративных галлюцинаций Whisper

Модель Whisper, ставшая стандартом для автоматического распознавания речи (ASR), страдает от серьезного недостатка: ее генеративный декодер склонен создавать «беглые», но бессмысленные тексты при обработке тишины или шума. Это явление, известное как галлюцинации, критично для приложений, где важна точность, а не просто наличие текста. Исследователи Maryam Abbasihafshejani и Murtuza Jadliwala из Университета штата Оклахома предложили решение, не требующее дообучения модели.

Метод: Проекция пространства галлюцинаций

Авторы разработали метод Hallucination Space Projection (HSP), который работает на этапе инференса. Суть метода заключается в вычислении компактного подпространства, ассоциированного с галлюцинациями, на основе калибровочных данных, содержащих только тишину или шум. Во время работы модели скрытые состояния декодера проецируются прочь от этого подпространства, что физически блокирует генерацию несуществующих слов.

Два режима работы и метрики

Исследователи протестировали два варианта применения проекции:

  • Always-on (Всегда включено): Проекция применяется ко всем входным данным. Это дает максимальное подавление галлюцинаций, но может влиять на распознавание реальной речи.
  • Gated (С вентилем): Проекция применяется только тогда, когда модель сама предполагает, что входные данные содержат мало или не содержат речи. Это обеспечивает баланс между точностью и чистотой транскрипта.

Результаты тестирования на бенчмарках, содержащих не-речевые данные, демонстрируют впечатляющие цифры:

Метрика / Режим Исходный уровень (Baseline) Always-on HSP Gated HSP
Средняя частота галлюцинаций (HR) 31.31% 2.44% 3.74%
Относительное снижение HR 92.21% 88.05%
Ложное отклонение речи (FRR) на LibriSpeech Информация недостаточна 0.41% – 9.97%
Рост WER (Word Error Rate) на LibriSpeech Информация недостаточна +0.33 – 4.39 п.п.

Почему это важно

Ключевое преимущество метода — отсутствие необходимости в переобучении (fine-tuning). Это означает, что разработчики могут внедрить HSP в существующие пайплайны обработки аудио «на лету», просто добавив слой проекции к активациям декодера. Метод позволяет гибко настраивать компромисс: если критична только чистота текста (например, в системах субтитрования тишины), используется режим Always-on. Если важна точность распознавания слов, режим Gated вносит минимальные изменения в WER (+0.33-4.39%), сохраняя при этом высокую надежность.

Источник: arXiv cs.AI ↗