Исследования4 сентября 2026 г., 09:19 МСК🤖 Auto

DuplexSpeechBench-IFEval: Почему голосовые AI теряют 9.7% эффективности без явных инструкций

Исследователи из Университета Мэриленда представили DSB-IFEval — первый бенчмарк для оценки способности полнодуплексных голосовых агентов следовать неявным инструкциям, заложенным в их персонажей.

Баннер новости 6752

Проблема неявного понимания ролей

Современные полнодуплексные голосовые агенты (full-duplex voice agents) должны непрерывно принимать решения: когда слушать, когда перебивать, как реагировать на наложения речи и когда уступать слово. Существующие бенчмарки тестируют эти навыки через явные инструкции по управлению очередью. Однако в реальных сценариях поведение агентов часто определяется лишь ролью или персонажем (persona), от которого система должна вывести правильные социальные паттерны. Это создает разрыв между тестами и реальностью.

Что такое DSB-IFEval

Авторы Puneet Mathur и Dinesh Manocha представили DuplexSpeechBench-IFEval (DSB-IFEval) — датасет из 1 038 тестовых случаев, охватывающих восемь различных ролей ассистентов. Бенчмарк оценивает пять протоколов условности:

  • Поведение по умолчанию;
  • Явные поведенческие инструкции;
  • Поведение, подразумеваемое персонажем;
  • Комбинированное условие (персонаж + правила);
  • Конфликт инструкций.

Метрики и результаты

Оценка проводилась на шести реальных системах в реальном времени. Использовались две ключевые метрики:

  • IAS (Instruction Adherence Score): детерминированная оценка соблюдения правил управления очередью (floor management).
  • PAS (Persona Adherence Score): оценка соответствия контента персонажу, судимая LLM.

Результаты выявили четкие архитектурные компромиссы. Полнодуплексные модели, такие как F-Actor и PersonaPlex, оказались крайне чувствительными к формату подачи инструкции. При переходе от явных инструкций к выводу из персонажа их adherence (соответствие) упало на 9.7% и 4.5% соответственно.

Категория моделей Представители Сильная сторона Слабая сторона
Полнодуплексные (Full-duplex) F-Actor, PersonaPlex Гибкость в управлении очередью Резкое падение IAS (-9.7% / -4.5%) при неявных инструкциях
Гибридные/Другие GPT-Realtime, MiniCPM-o, Fun-Audio-Chat Высокое PAS (следование контенту персонажа) Жесткость floor behavior; не адаптируются под неявные правила; слабые проактивные действия

Проблема безопасности и конфликтов

Отдельно исследователи отметили проблему разрешения конфликтов. Даже если системы надежно следуют директивам, предписанным их персонажем, они испытывают серьезные трудности с их переопределением в случае конфликта безопасности (safety conflict). Это указывает на то, что вывод поведения из роли, его исполнение в нужный момент и разрешение конкурирующих инструкций остаются тремя отдельными и сложными задачами для индустрии.

Почему это важно

DSB-IFEval демонстрирует, что текущие SOTA-модели не готовы к сложным социальным взаимодействиям, где поведение должно быть интуитивным, а не прописанным алгоритмически. Для разработчиков голосовых интерфейсов это сигнал: настройка через «персонажей» без явных правил floor management может привести к деградации качества диалога на 10% и выше.

Источник: arXiv cs.AI ↗