Проблема смешанных метрик в Agentic RL
В современных системах обучения с подкреплением (RL) для языковых моделей агент действует в замкнутом цикле, генерируя собственные наблюдения. Это создает фундаментальную проблему оценки: конечный успех (endpoint success) смешивает два разных навыка. Агент может прийти к успешному состоянию благодаря удачной навигации, а может — благодаря сильной логике решения, даже если стартовая позиция была сложной. Сравнение чекпоинтов SFT (Supervised Fine-Tuning) и RL на разных состояниях дает искаженную картину, так как выбирает агентов по результату, а не по способности.
Методология: Checkpoint Handoffs
Авторы предлагают протокол Checkpoint Handoffs, который позволяет изолировать эти компоненты. Суть метода:
- Клонирование состояния: Состояние, достигнутое одним чекпоинтом (например, SFT), клонируется и передается другому чекпоинту (например, RL).
- Разделение ролей: Вводится разделение на роль «Reacher» (тот, кто доводит до нужной точки) и «Solver» (тот, кто решает задачу из этой точки).
- Без переобучения: Оценка происходит без дообучения моделей, что позволяет чистое сравнение архитектур и стратегий.
Ключевые метрики
Введение раздельных метрик позволяет точнее атрибутировать прирост производительности:
- REACH: Доля случаев, когда политика доводит агента до состояния, которое находится в фиксированном числе шагов от успеха (подтверждено средой).
- SOLVE: Доля случаев, когда агент успешно завершает задачу, начиная с идентичного клонированного состояния.
Результаты на бенчмарках
Эксперименты проведены на двух независимых пайплайнах и бенчмарках. Ключевые выводы:
- Взаимодействие «Reacher by Solver» положительно во всех пяти проверенных условиях.
- История, полученная в процессе RL, ценнее для RL-решателя, чем для SFT-решателя.
- На бенчмарке ALFWorld RL улучшает оба показателя (и Reach, и Solve). Примечательно, что SFT-решатель никогда не достигает успеха там, где терпит неудачу RL-решатель.
Значение для индустрии
Предложенный подход требует лишь возможности воспроизведения истории одного чекпоинта в среде другого. Это позволяет долгосрочным оценкам (long-horizon evaluation) сообщать не только об итоговом успехе, но и о том, где именно произошел разрыв: в навигации по пространству состояний или в логическом решении задачи.
Источник: arXiv cs.AI ↗
