Проблема: отсутствие общей функции цели
Когда два LLM-агента с противоположными целями взаимодействуют в течение нескольких раундов, отсутствие общей функции цели приводит не к конкуренции, а к коллапсу. Исследователи (Alexander Liss, Nicholas Desmond, Santiago Gil Gallego) обнаружили, что посетитель сдается, а агент сайта перестает варьировать подход, что приводит к досрочному завершению диалога без достижения ни одной из целей.
Решение: Experience Orchestrator (EO)
Авторы предлагают контрольно-теоретический слой управления, который подменяет отсутствующую функцию цели. В симулированной среде финансовых услуг EO управляет совместной траекторией через три механизма:
- Contextual Bandit (CB): выбирает контентные «руки» (стратегии), калиброванные на основе реальной веб-аналитики.
- PID-контроллер: обеспечивает поведенческую согласованность через динамические ограничения схемы (schema constraints).
- POMDP-трекер убеждений: поддерживает вероятностную модель намерений посетителя.
Результаты: 60 000 симуляций
Ключевой вывод исследования: политика управления, а не начальные условия среды, определяет исход траектории. Вариант с Contextual Bandit объясняет 97% дисперсии результатов между факторами. EO демонстрирует значительное преимущество перед наивным LLM-контролем:
| Метрика | Наивный LLM-контроль | Experience Orchestrator (EO) | Прирост |
|---|---|---|---|
| Доля контактов с высоким намерением (Advisor Contact) | 46.1% | 78.1% | +32 п.п. |
Режимы поведения и ограничения
Анализ по персонажам выявил два режима: для посетителей без естественного склонности к конверсии слой управления является разницей между работоспособной и неработоспособной системой. Для тех, кто уже близок к согласию, эмпатичные дефолты наивного LLM достаточны.
Важное уточнение: все результаты получены в условиях LLM-to-LLM симуляции. PID-контроллер не был откалиброван на реальной человеческой непредсказуемости, поэтому валидация на живом трафике остается критическим следующим шагом.
Источник: arXiv cs.AI ↗
