Проблема «одностороннего успеха» в эволюции агентов
Современные LLM-агенты часто улучшаются не за счет обновления весов модели, а путем эволюции текстовых артефактов: промптов, чеклистов или рабочих процессов. Однако предыдущие исследования часто хвастались результатами только на тех бенчмарках, где метод сработал. Авторы новой работы (arXiv:2606.28374) провели честное сравнение «яблок с яблоками» и выявили главную проблему: не существует универсального лучшего артефакта для всех задач.
Архитектура RSEA: Три слоя состояния
Предложенный метод RSEA (Recursive Self-Evolving Agent) использует компактное трехслойное текстовое состояние, которое переписывает само на основе собственного опыта:
- Императивная стратегия: высокоуровневые инструкции.
- Повторно используемые навыки: конкретные действия.
- Процедурный плейбук: пошаговые алгоритмы.
Ключевое отличие RSEA — наличие «строгого фильтра» (keep-better gate). Кандидат на обновление принимается только в том случае, если он не показывает регрессии (ухудшения) на отложенной выборке (held-out split), не участвовавшей в обучении. Если эволюция угрожает производительностью, агент откатывается к базовому состоянию (vanilla ReAct).
Результаты бенчмарков: Алфавит против Вебшопа
Тестирование проводилось на четырех разнообразных задачах: ALFWorld, GAIA, τ-bench и WebShop. Сравнение шло с шестью базовыми методами (ReAct, Reflexion, GEPA, AWM, ACE, Dynamic Cheatsheet) на одном локальном бэкбоне. Результаты наглядно демонстрируют компромисс между гибкостью и стабильностью:
| Метод | ALFWorld (%) | WebShop (%) | Комментарий |
|---|---|---|---|
| RSEA (single-pass) | 69.3 | 0.43 | Лучший одиночный проход на ALFWorld (p=0.015 против ReAct) |
| RSEA (with retry) | 79.4 | 0.43 | Лучший общий результат на ALFWorld |
| ReAct (Baseline) | 64.6 | 0.43 | Базовый уровень, к которому откатывается RSEA при риске |
| Dynamic Cheatsheet | 70.7 | d>0.14 | Без защиты откатывается: высокий риск деградации |
| AWM | — | — | Лучший метод для сложных задач с инструментами (tool-use) |
Почему это важно для индустрии
Исследование доказывает, что незащищенная эволюция контекста опасна. Метод Dynamic Cheatsheet, который обновляет контекст онлайн без отложенной проверки, показал отличные результаты на ALFWorld (70.7%), но полностью провалился на WebShop (0.14% против 0.43% у базового ReAct). RSEA же гарантирует монотонную безопасность: он никогда не падает ниже уровня базового агента, так как откатывается к исходным настройкам, если новые инструкции оказываются вредными. Это делает RSEA более надежным кандидатом для продакшн-решений, где стабильность важнее максимизации метрики на одном датасете.
Источник: arXiv cs.AI ↗
