Суть проблемы: Benchmark Optimization
Публичные бенчмарки в области распознавания речи (ASR) всё чаще демонстрируют результаты на уровне человека. Однако исследователи из HumeAI (Theo Lebryk, Eric Bezzam и др.) выявили явление, которое они называют "benchmaxxing" — оптимизацию моделей под конкретные тесты. Модели учатся не распознавать речь, а угадывать эталонные транскрипты, основываясь на акустических артефактах датасетов, а не на содержании аудио.
Исследование охватывает 11 популярных open-source моделей. Ключевой вывод: модели с наилучшими показателями Word Error Rate (WER) чаще всего воспроизводят ошибки референсных транскриптов, даже когда аудио явно противоречит тексту.
Кейс VoxPopuli: Игнорирование «Thank you»
Датасет VoxPopuli известен высоким уровнем ошибок в транскрипции. Исследователи провели тест на Reference Disagreement: если аудио содержит фразу «Thank you, Mr. President», а в эталоне она пропущена, модель должна ли воспроизвести ошибку?
Результаты шокируют: 6 из 11 протестированных моделей проигнорировали слышимое «Thank you» и выдали ошибочный эталон. При этом модели копировали не только текст, но и стилистические особенности (например, отсутствие точки в «Mr» вместо «Mr.»). Поведение исчезало при использовании голосовых клонов или новых записей, что подтверждает зависимость от специфических акустических паттернов оригинального датасета.
| Модель | Реальный клип (VoxPopuli) | Клон того же спикера | Клон нового спикера (post-cutoff) |
|---|---|---|---|
| CohereLabs/cohere-transcribe-03-2026 | ❌ Mr President… | ❌ Mr President… | ✅ Thank you, Mr President… |
| nvidia/canary-qwen-2.5b | ❌ Mr President… | ❌ Mr President… | ✅ Thank you Mr. President… |
| ibm-granite/granite-speech-4.1-2b | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| microsoft/Phi-4-multimodal-instruct | ❌ Mr President… | ❌ Mr President… | ❌ Mr President… |
| nvidia/parakeet-tdt-0.6b-v2 | ❌ Mr President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| openai/whisper-large-v3 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
Примечание: ✅ — модель верно передала слышимое «Thank you», ❌ — воспроизвела ошибку датасета. Parakeet — единственная модель, изменившая поведение при клонировании голоса. Phi-4 сохранила ошибку даже на новом голосе.
Тест на маскировку: Тишина вместо цифр
Второй тест, Masked Entity Retrieval, заключался в полном удалении чисел из аудио. Логично ожидать, что модель не должна их транскрибировать. Однако некоторые модели, особенно топовые по бенчмаркам, продолжали вставлять числа из референсных текстов, а одна модель даже «додумала» случайный год (2011), которого не было в звуке.
Почему это важно?
Исследование выявило потенциальные ошибки в 40% клипов тестовой выборки VoxPopuli, затронувшие около 3% всех слов. Модели, демонстрирующие «benchmaxxing», воспроизводят ошибочные референсы в 18–30% случаев. Это означает, что текущие лидерборды (Open-ASR, Far-field ASR) могут переоценивать реальные способности систем, так как они не учитывают контекстную надежность и устойчивость к шуму датасета. HumeAI рекомендует использовать held-out sets (независимые выборки) для более честной оценки.
Источник: Hugging Face blog ↗
