Проблема: LLM начинают говорить сами с собой
Полнодуплексные модели (Full-Duplex Speech LLMs), такие как Moshi и PersonaPlex, способны слушать и говорить одновременно. Однако они подвержены серьезному дефекту: при длительном молчании пользователя модели начинают генерировать ложную речь (spurious onsets). В тестах на 5-минутных отрезках Moshi начинала говорить в 12 из 40 случаев, а PersonaPlex — в 11 из 40 случаев, даже когда входной сигнал был равен нулю (digital-zero input).
Диагностика: скачок вероятности в 9 порядков
Авторы исследования проверили две гипотезы: случайный выбор токенов при низких вероятностях или резкий скачок вероятности из-за условий на предыдущих выходах. Анализ показал, что в момент ложного старта вероятность речи возрастает более чем на 9 порядков в течение одного 80-мс кадра. Это подтверждает, что проблема кроется в каскадном эффекте условий модели, а не в случайности семплирования.
Решение: Контрфактуальный анализ
Для борьбы с эффектом предложен метод, не требующий переобучения (inference-time method). Он задает контрфактуальный вопрос: «Изменилось бы распределение следующего токена, если бы предыдущий ввод пользователя был заглушен?». Если распределение мало меняется, значит, модель реагирует на шум или артефакты, а не на речь, и такой старт подавляется.
Результаты: 100% точность сохранения ответов
Метод протестирован на 40 отложенных испытаниях для каждой модели с реалистичным фоновым шумом микрофона. Результаты демонстрируют полную эффективность:
| Метрика | Moshi | PersonaPlex |
|---|---|---|
| Ложные старты (Spurious Onsets) | 13/13 подавлено | 9/9 подавлено |
| Истинные ответы (Genuine Responses) | 40/40 сохранено | 40/40 сохранено |
| Задержка принятия решения (95-й перцентиль) | < 61 мс (в рамках бюджета 80 мс) | |
Метод работает в реальном времени и готов к интеграции. Код решения доступен в репозитории автора.
Источник: arXiv cs.CL ↗
