Проблема старых метрик
Голосовые интерфейсы стремительно заменяют текст, но существующие бенчмарки (WER, PESQ, DNSMOS) достигли насыщения и не отражают реальное качество взаимодействия. Пользователи отмечают, что модели могут звучать естественно, но терять нить разговора, путать интонации или не распознавать неуверенность в голосе. HumeAI подчеркивает: доступ к аудио не гарантирует, что модель использует паралингвистическую информацию (тон, паузы, акцент).
Масштаб исследования
Real World VoiceEQ — это первый крупный бенчмарк, основанный на человеческой оценке. Исследование опирается на базу из более чем 1 миллиона индивидуальных рейтингов, собранных через платформу Kairos. В тестировании участвовали 40+ проприетарных и open-source моделей (ASR, TTS, S2S), а сама база данных включает 785 000 оценок TTS и 48 000 оценок STS, что делает её одной из крупнейших в истории.
Ключевые выводы: специализация вместо универсальности
Гонка за «лучшей моделью» сменилась эрой специализации. В тестах TTS ни одна конфигурация не вошла в топ-5 сразу по всем 8 группам способностей. Модели, отлично справляющиеся с точными данными (номера карт, лекарства), часто проигрывают в эмоциональной выразительности. Ниже приведена сводка по основным направлениям оценки:
| Категория оценки | Что измеряется | Ключевая проблема |
|---|---|---|
| ASR (Распознавание) | Точность транскрипции в шум | WER в шуме может быть в 4 раза выше, чем в тишине; проблемы с акцентами |
| TTS (Генерация) | еЕстественность, эмпатия, идентичность | Нет единого лидера; модели теряют эмоциональный контекст |
| S2S (Понимание) | Реакция на тон, паузы, неуверенность | Модели часто игнорируют паралингвистические сигналы, полагаясь только на текст |
Ловушка автоматической оценки
Исследование выявило серьезный риск оптимизации моделей под публичные бенчмарки. Некоторые модели воспроизводили известные ошибки в эталонных транскриптах или «додумывали» слова, которых не было в аудио. При сравнении Speech-Language Models (SLM) с людьми-оценщиками согласие было высоким только в задачах с четким ответом (произношение). В субъективных задачах (оценка соответствия роли, сохранение идентичности) автоматические оценщики сильно уступали людям.
Почему это важно
Real World VoiceEQ вводит парадигму «человеко-ориентированной метрики». Для индустрии это сигнал: скорость и точность транскрипции больше не являются единственным критерием успеха. Будущие голосовые агенты должны уметь считывать уверенность, сарказм и эмпатию, чтобы конкурировать с людьми в сценариях поддержки, медицины и образования. Полный технический отчет и лидерборд доступны на Hugging Face.
Источник: Hugging Face blog ↗
