Исследования17 июля 2026 г., 02:18 МСК🤖 Auto

LAPO: Самообучение агентов без ревьюера через атрибуцию ходов

Исследователи представили LAPO — метод обучения с подкреплением, который оценивает полезность каждого шага поиска, заменяя его на заглушку и измеряя падение вероятности ответа.

Баннер новости 3770

Проблема терминальных наград

В традиционных подходах к обучению с подкреплением (RL) для многошагового поиска (multi-turn search reasoning) агенты получают награду только за финальный результат. Это создает «проблему кредитования»: алгоритм не может отличить полезный промежуточный шаг от вредного или избыточного, если в итоге ответ оказался верным. Отсутствие гранулярной обратной связи на каждом шаге ограничивает эффективность агентов в сложных задачах.

Механика LAPO: Leave-One-Turn Attribution

Авторы Qiang Zhu и Jiajun Wu предложили метод LAPO (Leave-One-Turn Attribution). Суть метода заключается в обратной атрибуции:

  • Для каждого хода поиска этот ход и полученные данные извлечения (retrieval observation) заменяются на фиксированный плейсхолдер [DELETE].
  • Измеряется изменение среднего логарифмического правдоподобия (mean log-likelihood) текущего полиси относительно правильного ответа (gold answer).
  • Этот показатель, названный Answer-Likelihood Gain, оценивает вклад конкретного хода, сохраняя контекст всех последующих взаимодействий.

Фильтрация шума: Sign-Consistency Gating

Чтобы отсечь ложноположительные сигналы, LAPO применяет sign-consistency gating. Метод сохраняет только нормализованные преимущества процесса (process advantages), направление которых совпадает с их сырыми оценками атрибуции. Это позволяет использовать только те шаги, которые статистически значимо улучшают или не ухудшают результат.

Результаты и сравнение

Метод не требует дополнительных моделей вознаграждения, учителей (teachers), верификаторов или LLM-as-a-Judge. Он полностью опирается на данные самого агента. Тестирование проводилось на семи наборах данных, требующих интенсивных знаний и локального поиска.

Метрика / Параметр Значение / Результат
Средний Exact-Match Score (7 датасетов) 0.326
Преимущество над базовой линией IGPO +0.053
Требования к инфраструктуре Нет внешних моделей/верификаторов
Дата публикации (arXiv) 15 июля 2026

Почему это важно

LAPO демонстрирует, что ретроспективная атрибуция, основанная на самом полиси, может эффективно заменять сложные системы оценки. Это снижает вычислительные затраты и упрощает пайплайн обучения агентов, способных к сложному логическому поиску в базах знаний.

Источник: arXiv cs.AI ↗