Проблема избыточных запросов
Современные языковые модели, использующие поиск (RAG-агенты), часто соверляют лишние запросы к внешним базам знаний. Существующие методы обучения с подкреплением (RL) либо дают слишком редкую обратную связь (только за финальный ответ), либо требуют дорогих аннотаций процессов. Внутренние метрики (энтропия, вероятность) отражают уверенность модели, но не факт, что ответ действительно основан на найденных доказательствах.
Решение: Search-G1
Команда авторов (Cheng Ruoxi, Ma Haoxuan и др.) предложила фреймворк Search-G1, который использует внутренние награды на основе представлений (representation-based intrinsic rewards). Система оценивает два ключевых показателя через калиброванные считыватели:
- Prompt-state readout: предсказывает, достаточно ли знаний модели для ответа без поиска (closed-book). Если нет — это сигнал к необходимости поиска.
- Answer-commit readout: оценивает зависимость ответа от доказательств. Если удаление найденного текста ухудшает ответ, значит, модель правильно использовала поиск.
Механика обучения
Search-G1 поощряет правильные траектории поиска только тогда, когда он необходим, и поощряет прямые ответы, когда знаний модели хватает. При этом система штрафует за повторные, избыточные поиски. Уникальность метода в том, что считыватели периодически переобучаются на новых траекториях из последних чекпоинтов, позволяя награде «со-эволюционировать» с политикой модели.
Результаты и значимость
Эксперименты на нескольких бенчмарках для поиска и двух масштабах моделей показали, что Search-G1 улучшает баланс между точностью и стоимостью поиска. Модель генерирует более короткие траектории ответов (меньше запросов), сохраняя конкурентную точность. Это снижает вычислительные затраты и задержки при развертывании агентов.
| Метрика | Описание в контексте Search-G1 |
|---|---|
| Grounding-Search-cost trade-off | Улучшение соотношения качества ответа (основанного на доказательствах) к количеству выполненных поисковых запросов. |
| Response-side trajectories | Длина последовательности действий модели. Search-G1 делает их короче, устраняя лишние шаги поиска. |
| Task accuracy | Точность решения задачи. Остается на конкурентном уровне с методами, использующими более дорогие сигналы обратной связи. |
Код проекта доступен в открытом доступе, что позволяет разработчикам интегрировать этот подход в свои RAG-системы для оптимизации затрат.
Источник: arXiv cs.CL ↗
