Исследования13 августа 2026 г., 07:17 МСК🤖 Auto

EO: Как PID-контроллер спасает LLM-агентов от коллапса диалога

Исследование arXiv:2608.11207 показывает, что без внешнего слоя управления мульти-LLM системы скатываются к провалу. Новый Experience Orchestrator (EO) повышает конверсию в контакт с консультантом на 32 п.п.

Баннер новости 5668

Проблема: отсутствие общей функции цели

Когда два LLM-агента с противоположными целями взаимодействуют в течение нескольких раундов, отсутствие общей функции цели приводит не к конкуренции, а к коллапсу. Исследователи (Alexander Liss, Nicholas Desmond, Santiago Gil Gallego) обнаружили, что посетитель сдается, а агент сайта перестает варьировать подход, что приводит к досрочному завершению диалога без достижения ни одной из целей.

Решение: Experience Orchestrator (EO)

Авторы предлагают контрольно-теоретический слой управления, который подменяет отсутствующую функцию цели. В симулированной среде финансовых услуг EO управляет совместной траекторией через три механизма:

  • Contextual Bandit (CB): выбирает контентные «руки» (стратегии), калиброванные на основе реальной веб-аналитики.
  • PID-контроллер: обеспечивает поведенческую согласованность через динамические ограничения схемы (schema constraints).
  • POMDP-трекер убеждений: поддерживает вероятностную модель намерений посетителя.

Результаты: 60 000 симуляций

Ключевой вывод исследования: политика управления, а не начальные условия среды, определяет исход траектории. Вариант с Contextual Bandit объясняет 97% дисперсии результатов между факторами. EO демонстрирует значительное преимущество перед наивным LLM-контролем:

Метрика Наивный LLM-контроль Experience Orchestrator (EO) Прирост
Доля контактов с высоким намерением (Advisor Contact) 46.1% 78.1% +32 п.п.

Режимы поведения и ограничения

Анализ по персонажам выявил два режима: для посетителей без естественного склонности к конверсии слой управления является разницей между работоспособной и неработоспособной системой. Для тех, кто уже близок к согласию, эмпатичные дефолты наивного LLM достаточны.

Важное уточнение: все результаты получены в условиях LLM-to-LLM симуляции. PID-контроллер не был откалиброван на реальной человеческой непредсказуемости, поэтому валидация на живом трафике остается критическим следующим шагом.

Источник: arXiv cs.AI ↗