Проблема «половинчатого» диалога
Традиционные голосовые AI работают в полудуплексном режиме: система ждет, пока пользователь закончит фразу, прежде чем отвечать. Это убивает естественность общения. Настоящий полнодуплексный диалог требует от агента проактивности — умения вовремя перебить (interruption) или поддержать беседу короткими вставками (backchannels), не теряя при этом качества ответа.
Решение: LPS-TC и датасет WildTurn
Команда авторов (включая исследователей из Университета Цинхуа и Alibaba) предложила обобщенную стилистически-осознанную архитектуру. Ключевым элементом стал LPS-TC (Lightweight Proactive Speech Turn Controller) — легковесный контроллер, который можно интегрировать как в полудуплексные модели (например, Qwen2.5-Omni), так и в полнодуплексные (Freeze-Omni), улучшая тайминг их работы.
Для обучения модели использован новый датасет WildTurn. Это крупнейшая на данный момент коллекция реальных английских разговоров:
- Объем: ~2 981 час стереозаписей.
- Источники: Личные встречи (face-to-face) и телефонные звонки.
- Аннотации: 5 стилей переключения реплик и 5 стилей бэкканнелинга.
Двухуровневая оценка
Авторы внедрили новую схему оценки, которая проверяет не только точность тайминга на уровне чанков (chunk-level), но и качество взаимодействия на уровне всей реплики (turn-level) в условиях потоковой передачи данных.
Результаты и значимость
Интеграция LPS-TC с существующими моделями показала превосходство в «пригодности» переключений и качестве ответов. Исследование, принятое к публикации в ACM MM 2026, доказывает, что добавление модуля контроля тайминга позволяет полудуплексным моделям имитировать человеческую динамику беседы, делая AI-ассистентов значительно более живыми и менее роботизированными.
Источник: arXiv cs.CL ↗
