Исследования22 августа 2026 г., 03:19 МСК🤖 Auto

Hear2Act: Почему интонация меняет решения ИИ-ассистентов

Исследователи представили Hear2Act — первый бенчмарк, доказывающий, что просодия (интонация) критически важна для действий голосовых ИИ, но только при наличии промежуточного текстового представления.

Баннер новости 6283

Проблема изолированных метрик

Существующие бенчмарки оценивают восприятие просодии, адекватность ответов и выполнение задач по отдельности. Это скрывает главный вопрос: меняет ли интонация реальные действия ассистента, если слова остаются прежними? Авторы из Microsoft Research (Xinyi Liu, Dilek Hakkani-Tur и др.) предлагают решение — Hear2Act, унифицированный протокол оценки для текстовых и голосовых LLM.

Методология: 480 сценариев с скрытыми намерениями

Бенчмарк состоит из 480 сценариев, основанных на персонажах, где скрыты реальные потребности пользователя. Ключевая особенность теста: задача и потребности фиксированы, но способ их подачи варьируется. В одних случаях проблема озвучивается явно, в других — передается исключительно через просодию (тон голоса, паузы, тембр), оставляя текст неизменным.

Результаты: Разрыв между пониманием и действием

Тестирование двух аудио-способных LLM выявило критический разрыв. Простое добавление аудио к тексту (Prosody-mediated feedback) дало ничтожный прирост в выборе оптимального решения: с 14.6% до 15.3%. Однако, когда модель сначала извлекала информацию из аудио, конвертировала её в текст и только затем принимала решение, результат вырос до 39.6%, что близко к эталонному значению в 40.7%.

Условие оценки Доля оптимальных решений Интерпретация
Только текст (Baseline) 14.6% Базовый уровень без учета интонации
Текст + Аудио (напрямую) 15.3% Игнорирование просодии при выборе действия
Текст + Аудио (через промежуточное представление) 39.6% Эффективное использование интонации
Ground-truth (Идеальный сценарий) 40.7% Максимально возможный результат

Вывод для индустрии

Результаты показывают, что просодия имеет значение именно тогда, когда лексической информации недостаточно. Однако современные аудио-модели не могут надежно перенести интонационные данные в действия без явного промежуточного текстового представления. Это указывает на необходимость архитектуры, где аудио-анализ предшествует логическому выбору действия, а не просто дополняет его.

Источник: arXiv cs.CL ↗