Проблема: «Стеклянный потолок» внутренней памяти
Существующие методы самоэволюции LLM-агентов ограничены тем, что модель уже знает. Они извлекают навыки из параметрических знаний или траекторий, но не могут выйти за эти границы. Профессиональные стандарты и процедурные знания часто лежат за пределами тренировочных данных. Search2Skill решает эту проблему, автоматически выявляя пробелы в компетенциях агента, находя внешние источники и дистиллируя их в структурированные навыки.
Механика: Рубричное обучение с подкреплением (Rubric-Based RL)
Ключевое отличие подхода — оптимизация через RL, которая учит модель не только генерировать ответ, но и управлять процессом поиска. Система обучается трем критическим навыкам:
- Когда искать: определять момент, когда внутренних знаний недостаточно.
- Как искать: формировать эффективные запросы к внешним источникам.
- Как генерировать навыки: преобразовывать сырые данные поиска в абстрактные, переиспользуемые правила.
Результаты: Превосходство на экспертных задачах
Эксперименты проводились на восьми экспертных доменах из трех бенчмарков. Search2Skill стабильно превосходит как методы с поисковой аугментацией (RAG), так и методы обучения на траекториях. Важно отметить, что прирост точности обусловлен именно абстракцией навыков, а не простым копированием найденных фрагментов текста. Приобретенные навыки демонстрируют способность к переносу (transfer) на модели разных масштабов.
Сравнительные характеристики
| Метод | Источник знаний | Механизм обучения | Результат (экспертные домены) |
|---|---|---|---|
| Search2Skill (предлагаемый) | Внешний поиск + RL | Рубричная оптимизация (поиск + генерация) | Лидер (стабильное превосходство) |
| Search-Augmented Baselines | Внешний поиск (RAG) | Прямое использование контекста | Ниже Search2Skill |
| Trajectory-based Methods | Внутренние траектории | Имитационное обучение | Ниже Search2Skill |
Значение для индустрии
Работа демонстрирует путь к созданию по-настоящему автономных агентов, способных к непрерывному обучению за счет интеграции с внешним миром. Перенос навыков между моделями разных размеров открывает возможности для эффективного масштабирования экспертных систем без необходимости переобучения каждой модели с нуля.
Источник: arXiv cs.AI ↗
