Проблема неявного понимания ролей
Современные полнодуплексные голосовые агенты (full-duplex voice agents) должны непрерывно принимать решения: когда слушать, когда перебивать, как реагировать на наложения речи и когда уступать слово. Существующие бенчмарки тестируют эти навыки через явные инструкции по управлению очередью. Однако в реальных сценариях поведение агентов часто определяется лишь ролью или персонажем (persona), от которого система должна вывести правильные социальные паттерны. Это создает разрыв между тестами и реальностью.
Что такое DSB-IFEval
Авторы Puneet Mathur и Dinesh Manocha представили DuplexSpeechBench-IFEval (DSB-IFEval) — датасет из 1 038 тестовых случаев, охватывающих восемь различных ролей ассистентов. Бенчмарк оценивает пять протоколов условности:
- Поведение по умолчанию;
- Явные поведенческие инструкции;
- Поведение, подразумеваемое персонажем;
- Комбинированное условие (персонаж + правила);
- Конфликт инструкций.
Метрики и результаты
Оценка проводилась на шести реальных системах в реальном времени. Использовались две ключевые метрики:
- IAS (Instruction Adherence Score): детерминированная оценка соблюдения правил управления очередью (floor management).
- PAS (Persona Adherence Score): оценка соответствия контента персонажу, судимая LLM.
Результаты выявили четкие архитектурные компромиссы. Полнодуплексные модели, такие как F-Actor и PersonaPlex, оказались крайне чувствительными к формату подачи инструкции. При переходе от явных инструкций к выводу из персонажа их adherence (соответствие) упало на 9.7% и 4.5% соответственно.
| Категория моделей | Представители | Сильная сторона | Слабая сторона |
|---|---|---|---|
| Полнодуплексные (Full-duplex) | F-Actor, PersonaPlex | Гибкость в управлении очередью | Резкое падение IAS (-9.7% / -4.5%) при неявных инструкциях |
| Гибридные/Другие | GPT-Realtime, MiniCPM-o, Fun-Audio-Chat | Высокое PAS (следование контенту персонажа) | Жесткость floor behavior; не адаптируются под неявные правила; слабые проактивные действия |
Проблема безопасности и конфликтов
Отдельно исследователи отметили проблему разрешения конфликтов. Даже если системы надежно следуют директивам, предписанным их персонажем, они испытывают серьезные трудности с их переопределением в случае конфликта безопасности (safety conflict). Это указывает на то, что вывод поведения из роли, его исполнение в нужный момент и разрешение конкурирующих инструкций остаются тремя отдельными и сложными задачами для индустрии.
Почему это важно
DSB-IFEval демонстрирует, что текущие SOTA-модели не готовы к сложным социальным взаимодействиям, где поведение должно быть интуитивным, а не прописанным алгоритмически. Для разработчиков голосовых интерфейсов это сигнал: настройка через «персонажей» без явных правил floor management может привести к деградации качества диалога на 10% и выше.
Источник: arXiv cs.AI ↗
