Исследования16 сентября 2026 г., 06:16 МСК🤖 Auto

Как остановить LLM от болтовни в тишине: новый метод для Full-Duplex моделей

Исследователь Кенто Ниси выявил причину ложных стартов речи в моделях Moshi и PersonaPlex и предложил метод исправления без переобучения, работающий в реальном времени.

Баннер новости 7595

Проблема: LLM начинают говорить сами с собой

Полнодуплексные модели (Full-Duplex Speech LLMs), такие как Moshi и PersonaPlex, способны слушать и говорить одновременно. Однако они подвержены серьезному дефекту: при длительном молчании пользователя модели начинают генерировать ложную речь (spurious onsets). В тестах на 5-минутных отрезках Moshi начинала говорить в 12 из 40 случаев, а PersonaPlex — в 11 из 40 случаев, даже когда входной сигнал был равен нулю (digital-zero input).

Диагностика: скачок вероятности в 9 порядков

Авторы исследования проверили две гипотезы: случайный выбор токенов при низких вероятностях или резкий скачок вероятности из-за условий на предыдущих выходах. Анализ показал, что в момент ложного старта вероятность речи возрастает более чем на 9 порядков в течение одного 80-мс кадра. Это подтверждает, что проблема кроется в каскадном эффекте условий модели, а не в случайности семплирования.

Решение: Контрфактуальный анализ

Для борьбы с эффектом предложен метод, не требующий переобучения (inference-time method). Он задает контрфактуальный вопрос: «Изменилось бы распределение следующего токена, если бы предыдущий ввод пользователя был заглушен?». Если распределение мало меняется, значит, модель реагирует на шум или артефакты, а не на речь, и такой старт подавляется.

Результаты: 100% точность сохранения ответов

Метод протестирован на 40 отложенных испытаниях для каждой модели с реалистичным фоновым шумом микрофона. Результаты демонстрируют полную эффективность:

Метрика Moshi PersonaPlex
Ложные старты (Spurious Onsets) 13/13 подавлено 9/9 подавлено
Истинные ответы (Genuine Responses) 40/40 сохранено 40/40 сохранено
Задержка принятия решения (95-й перцентиль) < 61 мс (в рамках бюджета 80 мс)

Метод работает в реальном времени и готов к интеграции. Код решения доступен в репозитории автора.

Источник: arXiv cs.CL ↗