Исследования31 июля 2026 г., 14:18 МСК🤖 Auto

SkillBoost: Как LLM-агенты учатся без переобучения

Исследователи представили SkillBoost — фреймворк, решающий проблему переобучения навыков LLM-агентов через балансировку исследования и эксплуатации.

Баннер новости 4806

Проблема: Ловушка самоэволюции

Создание автономных агентов на базе больших языковых моделей (LLM) сталкивается с фундаментальной проблемой: как накопленный опыт можно использовать повторно, не теряя общих способностей? Традиционные методы оптимизации «навыков» (skills) как состояний модели часто приводят к переобучению (overfitting) на ограниченном наборе траекторий из реальных сред. Агенты начинают идеально решать текущие задачи, но регрессируют на ранее решенных случаях при неограниченном исследовании новых путей.

Решение: Фреймворк SkillBoost

Команда авторов (Hongqiang Lin, Chao Liu и др.) предложила метод SkillBoost, который рассматривает самоэволюцию навыков как процесс с ограничениями. Метод работает в три этапа:

  • Структурированная эксплуатация (Structured Exploitation): локализация конкретных сбоев в редактируемых компонентах навыка.
  • Исследование с учетом приоритетов (Prior-Guided Exploration): генерация разнообразных кандидатов на исправление на основе предварительных знаний самой LLM.
  • Проверенное принятие (Verified Acceptance): кандидат фиксируется только если он улучшает производительность, не выходя за пределы допустимой регрессии.

Результаты: SOTA и переносимость

Эксперименты проведены в 23 конфигурациях «модель-бенчмарк». SkillBoost показал результаты уровня State-of-the-Art (SOTA), превзойдя как навыки, созданные людьми, так и сгенерированные LLM. Ключевое преимущество — способность оптимизированных навыков переноситься на других агентов для решения схожих задач.

Метрика / Аспект Результат / Характеристика
Количество конфигураций 23 (модель + бенчмарк)
Основной эффект Снижение переобучения (overfitting) и регрессии навыков
Сравнение с базовыми линиями Превосходство над human-crafted и LLM-generated skills
Ключевая инновация Баланс exploration-exploitation с проверкой на регрессию

Почему это важно

Работа демонстрирует, что автономное обучение агентов возможно без деградации общих компетенций. Это открывает путь к созданию самообучающихся систем, которые накапливают экспертизу, а не забывают старое ради нового.

Источник: arXiv cs.AI ↗