Замыкание разрыва между бенчмарками и реальностью
Стандартные датасеты вроде LibriSpeech оценивают модели на чистом, близком к микрофону звуке. Однако в реальных сценариях (умные колонки, автомобили, роботы) микрофон находится на расстоянии 1–3 метров, а фон заполнен эхом и шумом. Разрыв между результатами на бенчмарках и в «поле» оказывается критическим: модели, показывающие низкую ошибку на чистом звуке, могут терять до нескольких процентов точности при падении отношения сигнал/шум (SNR).
FFASR (Far-Field ASR Leaderboard) создан, чтобы количественно оценить этот разрыв. Это первый открытый, управляемый сообществом бенчмарк, который стандартизирует оценку ASR-моделей в реалистичных акустических средах.
Методология: Гибридная симуляция и 14 комнат
Вместо дорогостоящих физических измерений используется проприетарный движок Treble Technologies, сочетающий волновое моделирование (для низких/средних частот) и геометрическую акустику (для высоких). Это позволяет точно имитировать дифракцию, рассеивание и интерференцию.
Бенчмарк включает 14 полностью меблированных комнат объемом от 20 до 470 м³: ванные, офисы, классы, рестораны. Каждая сцена содержит:
- Одного целевого говорящего (записанного в безэховой камере).
- До трех источников шума (постоянный, например, HVAC, и прерывистый, например, кашель).
- Различные уровни SNR.
Ключевые метрики и условия тестирования
Рейтинг формируется на основе четырех основных условий, плюс дополнительные треки для валидации. Ниже приведена структура оценки:
| Условие | Описание | Значимость |
|---|---|---|
| Near-field (dry) | Чистый звук, без эха (анэхоичная камера) | Базовая линия, аналог Librispeech |
| Far-field High SNR | Удаленный микрофон, SNR > 14 дБ | Оценка базовой устойчивости к эху |
| Far-field Mid SNR | Удаленный микрофон, SNR 8–12 дБ | Средний уровень шума |
| Far-field Low SNR | Удаленный микрофон, SNR < 6 дБ | Максимальная нагрузка на модель |
| Lab Measured / Simulated | Сравнение реальных и сгенерированных данных | Валидация точности симуляции (sim-to-real) |
Помимо WER (Word Error Rate), для каждой модели измеряется RTFx (секунды аудио на секунду инференса) на GPU NVIDIA L4. Это позволяет строить графики Парето, выбирая оптимальный баланс между точностью и скоростью для конкретных деплойментов.
Что уже показывают данные
Первые результаты подтверждают гипотезу: разница между near-field и far-field WER огромна. При низком SNR ошибка распознавания возрастает в несколько раз по сравнению с чистым звуком. Бенчмарк также включает бета-версию теста с движущимся источником звука, что критично для голосовых помощников в автомобилях и робототехники.
Планы развития
В roadmap FFASR заявлена поддержка сценариев с несколькими говорящими (multi-talker), массивами микрофонов и алгоритмами подавления эха (echo cancellation). Платформа уже доступна на Hugging Face Spaces, и разработчики приглашают сообщество загружать свои модели для сравнения.
Источник: Hugging Face blog ↗
