Проблема: Ловушка самоэволюции
Создание автономных агентов на базе больших языковых моделей (LLM) сталкивается с фундаментальной проблемой: как накопленный опыт можно использовать повторно, не теряя общих способностей? Традиционные методы оптимизации «навыков» (skills) как состояний модели часто приводят к переобучению (overfitting) на ограниченном наборе траекторий из реальных сред. Агенты начинают идеально решать текущие задачи, но регрессируют на ранее решенных случаях при неограниченном исследовании новых путей.
Решение: Фреймворк SkillBoost
Команда авторов (Hongqiang Lin, Chao Liu и др.) предложила метод SkillBoost, который рассматривает самоэволюцию навыков как процесс с ограничениями. Метод работает в три этапа:
- Структурированная эксплуатация (Structured Exploitation): локализация конкретных сбоев в редактируемых компонентах навыка.
- Исследование с учетом приоритетов (Prior-Guided Exploration): генерация разнообразных кандидатов на исправление на основе предварительных знаний самой LLM.
- Проверенное принятие (Verified Acceptance): кандидат фиксируется только если он улучшает производительность, не выходя за пределы допустимой регрессии.
Результаты: SOTA и переносимость
Эксперименты проведены в 23 конфигурациях «модель-бенчмарк». SkillBoost показал результаты уровня State-of-the-Art (SOTA), превзойдя как навыки, созданные людьми, так и сгенерированные LLM. Ключевое преимущество — способность оптимизированных навыков переноситься на других агентов для решения схожих задач.
| Метрика / Аспект | Результат / Характеристика |
|---|---|
| Количество конфигураций | 23 (модель + бенчмарк) |
| Основной эффект | Снижение переобучения (overfitting) и регрессии навыков |
| Сравнение с базовыми линиями | Превосходство над human-crafted и LLM-generated skills |
| Ключевая инновация | Баланс exploration-exploitation с проверкой на регрессию |
Почему это важно
Работа демонстрирует, что автономное обучение агентов возможно без деградации общих компетенций. Это открывает путь к созданию самообучающихся систем, которые накапливают экспертизу, а не забывают старое ради нового.
Источник: arXiv cs.AI ↗
