Новый стандарт сложности: VAmoS Energy
Команда исследователей во главе с Joshua Meyer представила VAmoS Energy — новый бенчмарк для оценки голосовых AI-агентов. В отличие от предыдущих версий, этот тест симулирует реальные условия работы колл-центров: агенты должны обрабатывать множественные запросы, справляться с фоновым шумом и взаимодействовать с клиентами, теряющими терпение.
В основе теста лежат 100 вызовов, связанных с оплатой коммунальных услуг. Каждый виртуальный клиент ставит перед агентом от двух до четырех задач. Агенты имеют доступ к 16 инструментам, включая Stripe billing twin (двойник биллинга Stripe) и Apache Fineract (движок кредитования), при этом доступ к учетным записям блокируется до успешной верификации личности.
Методология и валидация
Для обеспечения реалистичности данные о потреблении электроэнергии взяты из открытых источников, а правила биллинга основаны на законодательстве штата Пенсильвания. Ключевым элементом проверки выступает LLM-as-a-verifier, который сверяет действия агента и произнесенные им цифры с явными требованиями. На этапе калибровки этот верификатор совпал с кодовым анализатором в 99,1% случаев, что подтверждает высокую надежность автоматической оценки.
Результаты тестирования: разрыв между моделями
Исследователи протестировали 14 различных голосовых стеков (voice stacks) с тремя повторами для каждой задачи. Результаты показали широкий разброс в эффективности: от 17,3% до 44,7% успешного завершения задач. Лидером стал Grok Voice, за ним следуют Gemini 3.8 Live и GPT-Live, которые демонстрируют сопоставимые результаты при схожей стоимости вызова.
| Модель / Агент | Результат (Completion Rate) | Примечание |
|---|---|---|
| Grok Voice | Лидер (точное значение в диапазоне 44.7%) | Лучший результат среди протестированных |
| Gemini 3.8 Live | ~40-44% | Сопоставимо с GPT-Live |
| GPT-Live | ~40-44% | Сопоставимо с Gemini 3.8 Live |
| Средний показатель (без шума) | 38.7% | Базовая успешность |
| Средний показатель (с ТВ) | 8.6% | Критическое падение из-за фонового шума |
Главный инсайт: проблема фонового шума
Самым тревожным результатом стало влияние фоновых звуков. Включение имитации работающего телевизора снизило общий показатель успешности выполнения задач с 38,7% до 8,6%. Это демонстрирует, что современные модели все еще критически уязвимы к шумам окружающей среды, что является главным барьером для внедрения голосовых агентов в реальных условиях.
Почему это важно для индустрии
Исследование выявило системную проблему: виртуальные клиенты часто принимают неверные результаты, потому что слышат слова агента, но не видят его внутренних действий (изменений в базе данных). Это создает риск финансовых ошибок и недовольства пользователей. Вывод авторов однозначен: для оценки голосовых AI-агентов необходимо проверять не только то, что они говорят, но и то, какие изменения они вносят в системы, а также их устойчивость к конкурентному речевому шуму.
Источник: arXiv cs.AI ↗
