Главная/Блог/Аналитика/Оптимизация бенчмарков в ASR: почему…
Аналитика15 мин чтения · 21 августа 2026 г.

Оптимизация бенчмарков в ASR: почему модели «запоминают» тесты

Исследование HumeAI показывает, что топовые модели распознавания речи часто воспроизводят ошибки из обучающих данных, игнорируя реальный аудиофайл. Разбираем, как работает «benchmaxxing» и почему это опасно для реальных продуктов.

Оптимизация бенчмарков в ASR: почему модели «запоминают» тесты

В мире искусственного интеллекта, особенно в области обработки естественного языка и распознавания речи, существует серьезная проблема, которую часто называют «benchmaxxing» (оптимизация под бенчмарки). Публичные тесты все чаще демонстрируют, что модели достигли «человеческого уровня» точности. Однако эти впечатляющие цифры не всегда отражают реальное поведение систем в производственной среде. Поскольку открытые бенчмарки широко доступны, модели могут стать оптимизированными под сами тесты: их баллы растут не потому, что они стали лучше понимать речь, а потому, что они выучили специфические паттерны конкретных наборов данных.

Традиционные бенчмарки часто упускают из виду множество условий и качеств, которые делают голосовые системы надежными, естественными и контекстуально уместными на практике. Именно поэтому такие платформы, как Real World VoiceEQ, Open-ASR Leaderboard и Far-field ASR Leaderboard, начали внедрять «held-out sets» (отложенные наборы данных), чтобы измерять то, что действительно важно для пользователя. Но одного расширения метрик недостаточно. Явление оптимизации под тесты трудно измерить, особенно в распознавании речи (ASR — Automatic Speech Recognition).

Недавние исследования от HumeAI вводят три новых теста для количественной оценки этого феномена. Авторы протестировали 11 широко используемых открытых моделей ASR и обнаружили, что многие из самых высокобалльных систем воспроизводят транскрипты из датасетов VoxPopuli и LibriSpeech, даже когда аудио явно противоречит тексту, когда ключевые слова были заглушены, или когда аудио одинаково хорошо поддерживает два разных варианта написания. В некоторых случаях модели опираются не только на то, что сказано, но и на тонкие акустические подсказки, указывающие на то, какой именно бенчмарк используется для тестирования. В результате их баллы завышают реальную способность модели к обобщению.

01Проблема несогласия с эталоном: кейс VoxPopuli

Датасет VoxPopuli, известный своими обширными записями европейских парламентских дебатов, имеет одну существенную особенность: в нем содержится большое количество ошибок транскрипции. Именно поэтому команда Artificial Analysis выпустила очищенную версию этого датасета. Чтобы понять, как современные модели справляются с такими ошибками, исследователи использовали метод «consensus disagreement probe» (зонд на несогласие консенсуса).

Суть теста проста, но эффективна: сталкиваются ли передовые модели ASR с ошибками в эталонной транскрипции, и если да, то как они реагируют? Транскрибируют ли они то, что слышат на самом деле, или же слепо воспроизводят ошибочный эталон бенчмарка? Для масштабного тестирования использовался ансамбль независимых моделей, выбранных за их низкий уровень ошибки фонем (PER — Phoneme Error Rate). PER является полезной прокси-метрикой, показывающей, насколько близко письменная транскрипция соответствует звукам в аудио. Результаты ансамбля позволяют выявить случаи, когда модели единогласно не согласны с эталонной транскрипцией бенчмарка. Затем выборка таких случаев сравнивается с аннотациями человека для валидации исправленных транскриптов.

Рассмотрим конкретный пример. В одном из клипов VoxPopuli отчетливо слышна фраза «Thank you, Mr. President» (Спасибо, господин президент), однако эталонная транскрипция опускает слова «Thank you». Шесть из одиннадцати протестированных моделей воспроизвели ошибочную транскрипцию бенчмарка, дав «ожидаемый» ответ, даже несмотря на то, что он противоречил аудио. На реальном клипе форматирование следует той же закономерности: модели, которые опускают «Thank you», также воспроизводят стиль пунктуации бенчмарка, записывая «Mr» без точки, в то время как модели, включающие слышимую фразу, склонны писать «Mr.» с точкой.

Когда мы представляем тот же контент в виде новых голосовых записей из парламентских заседаний ЕС или с использованием общих голосов, это поведение часто ослабевает или исчезает. В приведенных ниже примерах все модели, кроме одной, переключаются на транскрипцию, верную с точки зрения аудио, для клона новой парламентской записи. Это предполагает, что модели реагируют на акустические подсказки, которые помогают им идентифицировать принадлежность к бенчмарку, и, следовательно, производить ожидаемую транскрипцию, даже если она противоречит аудио.

График, показывающий зависимость ошибки слов (WER) от частоты воспроизведения ошибок эталона. Модели с лучшим WER чаще воспроизводят ошибки.
График, показывающий зависимость ошибки слов (WER) от частоты воспроизведения ошибок эталона. Модели с лучшим WER чаще воспроизводят ошибки.
💡
Важно понимать. Разница в пунктуации (наличие или отсутствие точки после «Mr») служит для моделей маркером принадлежности к конкретному датасету. Это не просто опечатка, а индикатор того, что модель «узнала» источник данных.

Таблица результатов: верность аудио против верности эталону

Эталонная транскрипция для этого клипа гласит: «Mr President, I have another complaint about this procedure, which is that it is not secret». Аудио во всех трех приведенных ниже клипах на самом деле говорит то же самое, но предваряется слышимым «Thank you» — клоны представляют собой синтез речи (TTS) этой истинной фразы, поэтому вежливость слышна во всех трех вариантах. Зеленое выделение и значок ✅ отмечают транскрипцию, включающую слышимое «Thank you»; красное выделение и значок ❌ отмечают воспроизведение ошибочного опущения из эталона бенчмарка. Все транскрипции являются сырым выводом модели до какой-либо нормализации — регистр и пунктуация сохраняются точно так, как они были сгенерированы, включая вывод в нижнем регистре от некоторых моделей.

terminaltext
Original VoxPopuli recording | Voice clone of the same speaker | Clone of a parliament speaker recorded after every model's training cutoff
CohereLabs/cohere-transcribe-03-2026 | ❌ Mr President… | ❌ Mr President… | ✅ Thank you, Mr President…
nvidia/canary-qwen-2.5b | ❌ Mr President… | ❌ Mr President… | ✅ Thank you Mr. President…
ibm-granite/granite-speech-4.1-2b | ❌ mr president… | ❌ mr president… | ✅ thank you mr president…
microsoft/Phi-4-multimodal-instruct | ❌ Mr President… | ❌ Mr President… | ❌ Mr President…
nvidia/parakeet-tdt-0.6b-v2 | ❌ Mr President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President…
bosonai/higgs-audio-v3-8b-stt-v2 | ❌ mr president… | ❌ mr president… | ✅ thank you mr president…
Qwen/Qwen3-ASR-0.6B-hf | ✅ Thank you, Mr. President… | ✅ Thank you, Mister President… | ✅ Thank you, Mister President…
mistralai/Voxtral-Mini-3B-2507 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President…
moonshotai/Kimi-Audio-7B-Instruct | ✅ Thank you, mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, mr. President…
openai/whisper-large-v3 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President…
moonshine-ai/moonshine-streaming-medium | ✅ thank you mr president… | ✅ thank you mr president… | ✅ thank you mr president…

Как видно из таблицы, Parakeet — единственная модель, которая переключается между воспроизведением бенчмарка на реальном клипе и правильным ответом на клоне того же говорящего. Phi-4 — единственная модель, которая все еще опускает вежливость на клоне «ep-fresh». Когда мы вместо этого ресинтезируем предложение в общем голосе TTS, не связанном ни с какими парламентскими записями, все одиннадцать моделей восстанавливают вежливость. Результаты свидетельствуют о том, что эта проблема является как повсеместной, так и значимой. Наша методология выявила потенциальные ошибки в эталоне в 40% проанализированных клипов VoxPopuli, затронув примерно 3% всех эталонных слов. Модели, демонстрирующие поведение, оптимизированное под бенчмарк, воспроизводили ошибочные эталонные транскрипты в 18–30% случаев.

02Заглушенные сущности: тест на извлечение чисел

Чтобы дополнить зонд на несогласие с эталоном, исследователи намеренно заглушили числа в аудиосэмплах тестовых наборов данных и попросили модели транскрибировать то, что они слышат. Число буквально отсутствует в аудио, поэтому модели не должны выводить никаких чисел, тем более точное число из текста. Некоторые из этих чисел являются полу-предсказуемыми (хотя предсказание их моделью все еще маловероятно), в то время как другие весьма удивительны.

Следующий клип объединяет оба зонда, показывая, как модели воссоздают ошибки эталонной транскрипции, включая неверное число, и как одна модель даже автодополняет относительно случайный год (2011), несмотря на то, что он был заглушен. В каждой строке модели:

  • Зеленое выделение с зачеркиванием отмечает слова эталонной транскрипции, которые модель правильно не воспроизвела (аудио-верно);
  • Зеленое выделение с подчеркиванием отмечает правильное, аудио-верное вставление вместо ошибочного wording эталона;
  • Красное выделение (plain text) воспроизводит ошибочный, не подтвержденный аудио контент эталонной транскрипции: сохранение «Mr President», написание «more than 1 amendments» там, где аудио говорит «one thousand six hundred», поставка заглушенного года «2011» или окончание на «plenary».
Пример транскрипции с заглушенными числами. Модель CohereLabs воспроизводит заглушенный год 2011, игнорируя аудио.
Пример транскрипции с заглушенными числами. Модель CohereLabs воспроизводит заглушенный год 2011, игнорируя аудио.

Пример: Заглушенное число в бюджетном комитете

terminaltext
Reference: Mr President, in the Committee on Budgets, we voted on more than amendments to the 2011 draft budget … voted in the plenary
What the audio says: In the Committee on Budgets, we voted on more than one thousand six hundred amendments to the ⟨silenced⟩ draft budget … voted in the …

CohereLabs/cohere-transcribe-03-2026: Mr President, in the Committee on Budgets we voted on more than amendments to the 2011 draft budget … voted in the plenary
nvidia/canary-qwen-2.5b: Mr President, in the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the plenary
ibm-granite/granite-speech-4.1-2b: Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted on in the plenary
microsoft/Phi-4-multimodal-instruct: Mr President In the Committee on Budgets we voted on more than amendments to the 2011 draft budget … voted on in the plenary
nvidia/parakeet-tdt-0.6b-v2: Mr President In the Committee on Budgets we voted on more than one amendments to the 2011 draft budget … voted in the Protestants.
bosonai/higgs-audio-v3-8b-stt-v2: Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
Qwen/Qwen3-ASR-0.6B-hf: Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
mistralai/Voxtral-Mini-3B-2507: Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshotai/Kimi-Audio-7B-Instruct: Mr President Ah in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary
openai/whisper-large-v3: Mr President In the Committee on Budgets, we voted on more than 1,600 amendments to the 2011 draft budget … voted in the plenary
moonshine-ai/moonshine-streaming-medium: Mr President in the committee on budgets we voted on more than one thousand six hundred amendments to the 2011 draft budget … voted in the plenary

Уровни восстановления были самыми высокими на публичных бенчмарках и ниже на отложенных или недавно собранных аудиоданных (ep-fresh и libri-fresh ниже). На LibriSpeech некоторые из самых сильных с точки зрения бенчмарка моделей воспроизводили заглушенные числа примерно в 30–40% примеров, даже когда само число было удалено. Эффект ослабевал на свежих данных для нескольких моделей, что предполагает, что окружающий контекст, связанный с бенчмарком, а не только текстовое автодополнение, помогает моделям восстановить эталон.

03Орфографические переключения: как модели угадывают стиль

Наш зонд орфографических переключений (orthographic switching probe) проверяет, воспроизводят ли модели точное написание, используемое в эталонной транскрипции бенчмарка, несмотря на то, что оно не является очевидным в аудио. Орфографические варианты — это слова, которые семантически и фонетически идентичны, но могут писаться по-разному (1 vs one, Mr. vs mister, John vs Jon, Honor vs Honour и т.д.). Теоретически модели должны последовательно предпочитать один вариант написания другому или чередовать их примерно со случайными частотами. Если модели систематически переключаются, чтобы соответствовать тому, что есть в эталонной транскрипции каждого бенчмарка, это предполагает, что модели подхватывают, какое написание ожидает тест.

Например, в транскрипции «I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE» модели используют «any one» в 6 из 11 случаев, а «anyone» — в 5 из 11. В то время как в транскрипции «CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD» модели используют «any one» в 2 из 11 случаев, а «anyone» — в 9 из 11.

Внутри LibriSpeech мы тестируем одно внутридатасетное переключение, включающее старую конвенцию пробелов: некоторые эталонные транскрипты используют «any one», в то время как другие используют «anyone». Мы измеряем минимальную точность для данного варианта, которую называем «скоростью переключения» (switch rate). Если модель использует только один вариант, ее скорость переключения будет равна 0%; модель, которая выбирает случайно, должна иметь скорость переключения около 50%. Модель, которая знает, какой вариант использовать в каждом тестовом образце, получит скорость переключения 100%.

Визуализация распределения орфографических вариантов 'any one' vs 'anyone' в зависимости от датасета.
Визуализация распределения орфографических вариантов 'any one' vs 'anyone' в зависимости от датасета.

Наш второй зонд тестирует междатасетное переключение, при котором каждый бенчмарк последовательно использует другую конвенцию написания по всему своему корпусу тестов. Например, VoxPopuli использует сокращение «Mr.», в то время как LibriSpeech пишет слово полностью — «Mister». Многие модели превышают базовый уровень случайного выбора в 50%, некоторые достигают точности переключения примерно в 90%.

Это предполагает, что модели могут определить, из какого набора данных взят аудиосэмпл, и выбрать конвенцию написания, которую ожидает бенчмарк, даже если обе формы звучат идентично. Это серьезное нарушение принципа объективного распознавания речи: модель должна транскрибировать звук, а не угадывать стиль документа.

04Локализация переключений: влияние контекста

Чтобы проверить, обобщаются ли эти поведения за пределы публичных бенчмарков, мы также собрали свежие данные из тех же доменных источников, но после временных срезов обучения моделей: недавние записи Европейского парламента для VoxPopuli и записи от новых активных дикторов LibriVox для LibriSpeech. Однако, когда моделям предъявляются недавно собранные данные из той же доменной области, многие модели перестают соответствовать эталонной транскрипции и возвращаются к более точным с точки зрения аудио транскрипциям.

Сравнение транскрипций на оригинальных данных и на свежих данных (ep-fresh). Видно, что на свежих данных модели чаще возвращаются к аудио-верной транскрипции.
Сравнение транскрипций на оригинальных данных и на свежих данных (ep-fresh). Видно, что на свежих данных модели чаще возвращаются к аудио-верной транскрипции.

Другие вмешательства указывают на тот же вывод. Фразы, которые присутствуют в аудио, но опущены в эталонной транскрипции, могут появиться снова, когда модель попросить перевести аудио или когда ее внимание ограничено соответствующими кадрами. Удаление окружающего контекста, связанного с бенчмарком, или добавление обычной разговорной речи также может восстановить точную транскрипцию. Добавление аудио VoxPopuli может иметь обратный эффект, делая иначе точные синтетические или найденные образцы более склонными к соответствию эталонной транскрипции бенчмарка.

⚠️
Ключевой вывод. Модели способны точно транскрибировать буквально произнесенные слова, но используют окружающий акустический контекст, чтобы решить, следовать ли аудио или специфической для бенчмарка политике транскрипции. Это означает, что «шум» фона или стиль записи могут стать сигналом для модели.

05Почему это происходит: акустические маркеры датасета

Вместе эти результаты предполагают, что модели могут точно транскрибировать буквально произнесенные слова, но используют окружающий акустический контекст, чтобы решить, следовать ли аудио или специфической для бенчмарка политике транскрипции. Это явление часто называют «data leakage» (утечкой данных) в акустической форме. Модель не просто видит текст; она «слышит» особенности записи, которые коррелируют с конкретным датасетом.

Например, качество записи, уровень шума, интонация диктора или даже технические параметры кодирования аудио могут служить неявными маркерами. Если модель обучалась на VoxPopuli, она могла выучить корреляцию между определенным акустическим профилем и использованием сокращения «Mr.», а не «Mister». Когда она сталкивается с новым аудио, имеющим схожий акустический профиль, она активирует эту «политику» написания, даже если она не основана на звуке.

Это создает серьезную проблему для оценки моделей. Если модель достигает высокой точности на публичном бенчмарке не потому, что она лучше понимает речь, а потому, что она лучше «узнает» датасет, то ее реальная полезность в мире, где качество записи и стиль речи варьируются, будет значительно ниже. Это особенно критично для приложений, требующих высокой надежности, таких как юридические стенограммы, медицинская документация или автоматическое субтитрование.

06Что это значит на практике

Для людей, выбирающих модели, эти выводы подчеркивают важность использования полностью отложенных наборов данных для оценки, как это делают RW-Voice-EQ Bench и Open ASR Leaderboard, и выхода за рамки ошибки слова (WER) на одном публичном бенчмарке. Для этой цели на Open ASR Leaderboard была добавлена вкладка «Benchmark fitting», которая включает два из вышеуказанных анализов для всех моделей: количественная оценка (1) уровней ошибок в эталоне из VoxPopuli и (2) скоростей орфографических переключений.

Что это значит для разработчиков и энтузиастов AI в России и других странах?

  1. Не доверяйте слепо WER. Низкая ошибка слова на LibriSpeech или VoxPopuli не гарантирует, что модель будет хорошо работать на ваших записях. Всегда тестируйте модель на собственных данных или на «свежих» наборах, которые не входили в обучающую выборку.
  2. Используйте held-out sets. Если вы оцениваете модель, убедитесь, что тестовые данные не пересекаются с обучающими. Платформы вроде Hugging Face позволяют загружать свои датасеты, но важно проверять, не были ли они случайно включены в обучение.
  3. Обращайте внимание на контекст. Если вы используете модель для специфической задачи (например, распознавание речи в шумном офисе), убедитесь, что модель обучалась на данных с похожим уровнем шума. Иначе модель может «сбиться с толку» из-за акустических маркеров.
  4. Локальный запуск и контроль. Запуск моделей локально (например, через Ollama или LM Studio) дает вам полный контроль над входными данными. Вы можете предварительно обработать аудио, чтобы убрать акустические маркеры, или использовать техники prompt-инжиниринга, чтобы указать модели, что она должна игнорировать стилистические предпочтения.
Общий вид интерфейса Open ASR Leaderboard с вкладкой Benchmark fitting.
Общий вид интерфейса Open ASR Leaderboard с вкладкой Benchmark fitting.

В заключение, исследование HumeAI служит важным предупреждением для сообщества AI. Погоня за высокими баллами на публичных бенчмарках может привести к созданию моделей, которые являются «специалистами по тестам», а не «специалистами по речи». Для достижения истинного прогресса в распознавании речи необходимо сосредоточиться на оценке в реальных условиях, используя разнообразные, чистые и актуальные наборы данных. Только так мы сможем создать системы, которые действительно понимают речь, а не просто угадывают ответы.

Источник: Hugging Face ↗