Исследования19 сентября 2026 г., 06:17 МСК🤖 Auto

Reach or Solve? Как отделить навигацию от логики в Agentic RL

Исследователи представили метод Checkpoint Handoffs, позволяющий раздельно оценивать способность агента находить путь к цели (Reach) и решать задачу из найденной точки (Solve).

Баннер новости 7852

Проблема смешанных метрик в Agentic RL

В современных системах обучения с подкреплением (RL) для языковых моделей агент действует в замкнутом цикле, генерируя собственные наблюдения. Это создает фундаментальную проблему оценки: конечный успех (endpoint success) смешивает два разных навыка. Агент может прийти к успешному состоянию благодаря удачной навигации, а может — благодаря сильной логике решения, даже если стартовая позиция была сложной. Сравнение чекпоинтов SFT (Supervised Fine-Tuning) и RL на разных состояниях дает искаженную картину, так как выбирает агентов по результату, а не по способности.

Методология: Checkpoint Handoffs

Авторы предлагают протокол Checkpoint Handoffs, который позволяет изолировать эти компоненты. Суть метода:

  • Клонирование состояния: Состояние, достигнутое одним чекпоинтом (например, SFT), клонируется и передается другому чекпоинту (например, RL).
  • Разделение ролей: Вводится разделение на роль «Reacher» (тот, кто доводит до нужной точки) и «Solver» (тот, кто решает задачу из этой точки).
  • Без переобучения: Оценка происходит без дообучения моделей, что позволяет чистое сравнение архитектур и стратегий.

Ключевые метрики

Введение раздельных метрик позволяет точнее атрибутировать прирост производительности:

  • REACH: Доля случаев, когда политика доводит агента до состояния, которое находится в фиксированном числе шагов от успеха (подтверждено средой).
  • SOLVE: Доля случаев, когда агент успешно завершает задачу, начиная с идентичного клонированного состояния.

Результаты на бенчмарках

Эксперименты проведены на двух независимых пайплайнах и бенчмарках. Ключевые выводы:

  1. Взаимодействие «Reacher by Solver» положительно во всех пяти проверенных условиях.
  2. История, полученная в процессе RL, ценнее для RL-решателя, чем для SFT-решателя.
  3. На бенчмарке ALFWorld RL улучшает оба показателя (и Reach, и Solve). Примечательно, что SFT-решатель никогда не достигает успеха там, где терпит неудачу RL-решатель.

Значение для индустрии

Предложенный подход требует лишь возможности воспроизведения истории одного чекпоинта в среде другого. Это позволяет долгосрочным оценкам (long-horizon evaluation) сообщать не только об итоговом успехе, но и о том, где именно произошел разрыв: в навигации по пространству состояний или в логическом решении задачи.

Источник: arXiv cs.AI ↗