Исследования1 октября 2026 г., 22:20 МСК🤖 Auto

VAmoS Energy: Почему голосовые AI-агенты проваливают тесты с фоновым шумом

Исследователи представили VAmoS Energy — сложный бенчмарк для голосовых AI-агентов, имитирующий реальные вызовы в службу поддержки. Тест показал, что фоновый шум снижает успешность выполнения задач с 38,7% до 8,6%, а лидеры рынка Grok и Gemini лишь н

Баннер новости 8721

Новый стандарт сложности: VAmoS Energy

Команда исследователей во главе с Joshua Meyer представила VAmoS Energy — новый бенчмарк для оценки голосовых AI-агентов. В отличие от предыдущих версий, этот тест симулирует реальные условия работы колл-центров: агенты должны обрабатывать множественные запросы, справляться с фоновым шумом и взаимодействовать с клиентами, теряющими терпение.
В основе теста лежат 100 вызовов, связанных с оплатой коммунальных услуг. Каждый виртуальный клиент ставит перед агентом от двух до четырех задач. Агенты имеют доступ к 16 инструментам, включая Stripe billing twin (двойник биллинга Stripe) и Apache Fineract (движок кредитования), при этом доступ к учетным записям блокируется до успешной верификации личности.

Методология и валидация

Для обеспечения реалистичности данные о потреблении электроэнергии взяты из открытых источников, а правила биллинга основаны на законодательстве штата Пенсильвания. Ключевым элементом проверки выступает LLM-as-a-verifier, который сверяет действия агента и произнесенные им цифры с явными требованиями. На этапе калибровки этот верификатор совпал с кодовым анализатором в 99,1% случаев, что подтверждает высокую надежность автоматической оценки.

Результаты тестирования: разрыв между моделями

Исследователи протестировали 14 различных голосовых стеков (voice stacks) с тремя повторами для каждой задачи. Результаты показали широкий разброс в эффективности: от 17,3% до 44,7% успешного завершения задач. Лидером стал Grok Voice, за ним следуют Gemini 3.8 Live и GPT-Live, которые демонстрируют сопоставимые результаты при схожей стоимости вызова.

Модель / Агент Результат (Completion Rate) Примечание
Grok Voice Лидер (точное значение в диапазоне 44.7%) Лучший результат среди протестированных
Gemini 3.8 Live ~40-44% Сопоставимо с GPT-Live
GPT-Live ~40-44% Сопоставимо с Gemini 3.8 Live
Средний показатель (без шума) 38.7% Базовая успешность
Средний показатель (с ТВ) 8.6% Критическое падение из-за фонового шума

Главный инсайт: проблема фонового шума

Самым тревожным результатом стало влияние фоновых звуков. Включение имитации работающего телевизора снизило общий показатель успешности выполнения задач с 38,7% до 8,6%. Это демонстрирует, что современные модели все еще критически уязвимы к шумам окружающей среды, что является главным барьером для внедрения голосовых агентов в реальных условиях.

Почему это важно для индустрии

Исследование выявило системную проблему: виртуальные клиенты часто принимают неверные результаты, потому что слышат слова агента, но не видят его внутренних действий (изменений в базе данных). Это создает риск финансовых ошибок и недовольства пользователей. Вывод авторов однозначен: для оценки голосовых AI-агентов необходимо проверять не только то, что они говорят, но и то, какие изменения они вносят в системы, а также их устойчивость к конкурентному речевому шуму.

Источник: arXiv cs.AI ↗