Проблема самоэволюции: оптимизатор против вратаря
Современные LLM-агенты способны к самоэволюции, редактируя свой персистентный документ навыков (workflow, правила использования инструментов). Этот процесс состоит из двух шагов: оптимизатор предлагает правку, а gate (ворота) принимает или отклоняет её. До сих пор фокус был на улучшении оптимизатора, тогда как gate использовал наивное правило: принимать любую правку, повышающую средний балл валидации.
Авторы статьи (Yihao Wang, Linhan Xia и др.) доказывают, что этот подход критически уязвим к двум проблемам:
- Постоянная регрессия: правка может улучшить средний балл, но сломать задачи, которые агент уже решал успешно.
- Проклятие оптимизатора (Optimizer's Curse): на конечных и зашумленных наборах данных лучший наблюдаемый балл часто завышен, что приводит к ложноположительным решениям.
Решение SAGE: статистическая строгость
Предложенный метод SAGE (Statistical Acceptance Gate) заменяет наивную проверку на два строгих статистических механизма:
- Парное сравнение по элементам (Per-item paired comparison): оценивает текущий и измененный навыки на идентичных валидационных примерах. Это выявляет регрессию, скрытую средним баллом, и асимметрично штрафует за ухудшение.
- Односторонний парный тест: правка принимается только тогда, когда количество побед статистически значимо превышает количество поражений. В противном случае система воздерживается от изменений.
Результаты: от 36.5% регрессии к нулю
Эксперименты проводились на пяти бенчмарках с использованием четырех бэкбонов LLM (включая DeepSeek-V4) при равном вычислительном бюджете. SAGE снизила частоту регрессии в 19 из 20 конфигураций. Ключевые метрики представлены ниже:
| Бенчмарк | Модель | Регрессия (Baseline → SAGE) | Финальный балл (LiveMath) |
|---|---|---|---|
| LiveMath | DeepSeek-V4 | 36.5% → 0% | 34.15 → 48.78 |
| OfficeQA | DeepSeek-V4 | 42.8% → 0% | — |
| Все 20 настроек | 4 LLM | Снижение в 19 случаях | Наивысший балл во всех |
Почему это важно
SAGE демонстрирует, что консервативный, статистически обоснованный подход к фильтрации изменений эффективнее агрессивной оптимизации. Отказ от «покупки» общего прогресса за счет разрушения уже существующих навыков позволяет агентам накапливать компетенции без деградации, что критично для создания надежных автономных систем.
Источник: arXiv cs.AI ↗
