Исследования7 августа 2026 г., 12:17 МСК🤖 Auto

Search2Skill: RL-дистилляция знаний из поиска для LLM-агентов

Исследователи представили Search2Skill — фреймворк, использующий рубричное обучение с подкреплением для превращения внешних поисковых данных в переиспользуемые навыки, преодолевая ограничения внутренней базы знаний моделей.

Баннер новости 5292

Проблема: «Стеклянный потолок» внутренней памяти

Существующие методы самоэволюции LLM-агентов ограничены тем, что модель уже знает. Они извлекают навыки из параметрических знаний или траекторий, но не могут выйти за эти границы. Профессиональные стандарты и процедурные знания часто лежат за пределами тренировочных данных. Search2Skill решает эту проблему, автоматически выявляя пробелы в компетенциях агента, находя внешние источники и дистиллируя их в структурированные навыки.

Механика: Рубричное обучение с подкреплением (Rubric-Based RL)

Ключевое отличие подхода — оптимизация через RL, которая учит модель не только генерировать ответ, но и управлять процессом поиска. Система обучается трем критическим навыкам:

  • Когда искать: определять момент, когда внутренних знаний недостаточно.
  • Как искать: формировать эффективные запросы к внешним источникам.
  • Как генерировать навыки: преобразовывать сырые данные поиска в абстрактные, переиспользуемые правила.

Результаты: Превосходство на экспертных задачах

Эксперименты проводились на восьми экспертных доменах из трех бенчмарков. Search2Skill стабильно превосходит как методы с поисковой аугментацией (RAG), так и методы обучения на траекториях. Важно отметить, что прирост точности обусловлен именно абстракцией навыков, а не простым копированием найденных фрагментов текста. Приобретенные навыки демонстрируют способность к переносу (transfer) на модели разных масштабов.

Сравнительные характеристики

Метод Источник знаний Механизм обучения Результат (экспертные домены)
Search2Skill (предлагаемый) Внешний поиск + RL Рубричная оптимизация (поиск + генерация) Лидер (стабильное превосходство)
Search-Augmented Baselines Внешний поиск (RAG) Прямое использование контекста Ниже Search2Skill
Trajectory-based Methods Внутренние траектории Имитационное обучение Ниже Search2Skill

Значение для индустрии

Работа демонстрирует путь к созданию по-настоящему автономных агентов, способных к непрерывному обучению за счет интеграции с внешним миром. Перенос навыков между моделями разных размеров открывает возможности для эффективного масштабирования экспертных систем без необходимости переобучения каждой модели с нуля.

Источник: arXiv cs.AI ↗