Исследования22 августа 2026 г., 07:19 МСК🤖 Auto

HumeAI: Модели ASR заучили тесты, а не речь. Разоблачение 'benchmaxxing'

Исследование HumeAI показало, что топовые модели распознавания речи (Whisper, Phi-4) часто воспроизводят ошибки из обучающих датасетов VoxPopuli и LibriSpeech, игнорируя реальный аудио-сигнал. Это ставит под сомнение их реальную точность.

Баннер новости 6295

Суть проблемы: Benchmark Optimization

Публичные бенчмарки в области распознавания речи (ASR) всё чаще демонстрируют результаты на уровне человека. Однако исследователи из HumeAI (Theo Lebryk, Eric Bezzam и др.) выявили явление, которое они называют "benchmaxxing" — оптимизацию моделей под конкретные тесты. Модели учатся не распознавать речь, а угадывать эталонные транскрипты, основываясь на акустических артефактах датасетов, а не на содержании аудио.

Исследование охватывает 11 популярных open-source моделей. Ключевой вывод: модели с наилучшими показателями Word Error Rate (WER) чаще всего воспроизводят ошибки референсных транскриптов, даже когда аудио явно противоречит тексту.

Кейс VoxPopuli: Игнорирование «Thank you»

Датасет VoxPopuli известен высоким уровнем ошибок в транскрипции. Исследователи провели тест на Reference Disagreement: если аудио содержит фразу «Thank you, Mr. President», а в эталоне она пропущена, модель должна ли воспроизвести ошибку?

Результаты шокируют: 6 из 11 протестированных моделей проигнорировали слышимое «Thank you» и выдали ошибочный эталон. При этом модели копировали не только текст, но и стилистические особенности (например, отсутствие точки в «Mr» вместо «Mr.»). Поведение исчезало при использовании голосовых клонов или новых записей, что подтверждает зависимость от специфических акустических паттернов оригинального датасета.

Модель Реальный клип (VoxPopuli) Клон того же спикера Клон нового спикера (post-cutoff)
CohereLabs/cohere-transcribe-03-2026 ❌ Mr President… ❌ Mr President… ✅ Thank you, Mr President…
nvidia/canary-qwen-2.5b ❌ Mr President… ❌ Mr President… ✅ Thank you Mr. President…
ibm-granite/granite-speech-4.1-2b ❌ mr president… ❌ mr president… ✅ thank you mr president…
microsoft/Phi-4-multimodal-instruct ❌ Mr President… ❌ Mr President… ❌ Mr President…
nvidia/parakeet-tdt-0.6b-v2 ❌ Mr President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…
openai/whisper-large-v3 ✅ Thank you, Mr. President… ✅ Thank you, Mr. President… ✅ Thank you, Mr. President…

Примечание: ✅ — модель верно передала слышимое «Thank you», ❌ — воспроизвела ошибку датасета. Parakeet — единственная модель, изменившая поведение при клонировании голоса. Phi-4 сохранила ошибку даже на новом голосе.

Тест на маскировку: Тишина вместо цифр

Второй тест, Masked Entity Retrieval, заключался в полном удалении чисел из аудио. Логично ожидать, что модель не должна их транскрибировать. Однако некоторые модели, особенно топовые по бенчмаркам, продолжали вставлять числа из референсных текстов, а одна модель даже «додумала» случайный год (2011), которого не было в звуке.

Почему это важно?

Исследование выявило потенциальные ошибки в 40% клипов тестовой выборки VoxPopuli, затронувшие около 3% всех слов. Модели, демонстрирующие «benchmaxxing», воспроизводят ошибочные референсы в 18–30% случаев. Это означает, что текущие лидерборды (Open-ASR, Far-field ASR) могут переоценивать реальные способности систем, так как они не учитывают контекстную надежность и устойчивость к шуму датасета. HumeAI рекомендует использовать held-out sets (независимые выборки) для более честной оценки.

Источник: Hugging Face blog ↗