Проблема: «Слепое» восстановление вредит
Агенты на базе больших языковых моделей (LLM) часто сталкиваются с ошибками выполнения. Стандартный подход — автоматически запускать механизм восстановления (recovery) при сбое. Однако новое исследование показывает, что это не всегда полезно: одна и та же операция может спасти проваливающийся сценарий, но при этом разрушить тот, который уже был на пути к успеху. Традиционные метрики, основанные на среднем успехе, скрывают эту двойственность.
Решение: Causal Intervention Router (CIR)
Команда авторов предложила рассматривать восстановление как каузальную задачу принятия решений. Алгоритм CIR анализирует состояние выполнения до вмешательства и решает, стоит ли вообще запускать recovery-механизм. Ключевая особенность — CIR не трогает траектории, которые уже содержат правильные наблюдения, исключая ложноположительные вмешательства.
Результаты на Qwen3-14B
Эксперименты проводились на долгосрочных задачах ALFWorld с использованием модели Qwen3-14B. Применение CIR позволило статистически значимо повысить эффективность агентов:
| Метрика | Без CIR | С CIR | Прирост |
|---|---|---|---|
| Успешность выполнения | 70.33% | 73.33% | +3.00 п.п. |
| Сохранность успешных траекторий | — | 100% | Нулевой вред |
Почему это важно
Дополнительные контрольные эксперименты показали, что улучшение результатов обусловлено не просто получением новой информации от окружения, а именно качественным выбором момента вмешательства. Это открывает путь к созданию более надежных автономных систем, где экономия вычислительных ресурсов и минимизация рисков деструктивных действий становятся приоритетом.
Источник: arXiv cs.AI ↗
