Проблема терминальных наград
В традиционных подходах к обучению с подкреплением (RL) для многошагового поиска (multi-turn search reasoning) агенты получают награду только за финальный результат. Это создает «проблему кредитования»: алгоритм не может отличить полезный промежуточный шаг от вредного или избыточного, если в итоге ответ оказался верным. Отсутствие гранулярной обратной связи на каждом шаге ограничивает эффективность агентов в сложных задачах.
Механика LAPO: Leave-One-Turn Attribution
Авторы Qiang Zhu и Jiajun Wu предложили метод LAPO (Leave-One-Turn Attribution). Суть метода заключается в обратной атрибуции:
- Для каждого хода поиска этот ход и полученные данные извлечения (retrieval observation) заменяются на фиксированный плейсхолдер
[DELETE]. - Измеряется изменение среднего логарифмического правдоподобия (mean log-likelihood) текущего полиси относительно правильного ответа (gold answer).
- Этот показатель, названный Answer-Likelihood Gain, оценивает вклад конкретного хода, сохраняя контекст всех последующих взаимодействий.
Фильтрация шума: Sign-Consistency Gating
Чтобы отсечь ложноположительные сигналы, LAPO применяет sign-consistency gating. Метод сохраняет только нормализованные преимущества процесса (process advantages), направление которых совпадает с их сырыми оценками атрибуции. Это позволяет использовать только те шаги, которые статистически значимо улучшают или не ухудшают результат.
Результаты и сравнение
Метод не требует дополнительных моделей вознаграждения, учителей (teachers), верификаторов или LLM-as-a-Judge. Он полностью опирается на данные самого агента. Тестирование проводилось на семи наборах данных, требующих интенсивных знаний и локального поиска.
| Метрика / Параметр | Значение / Результат |
|---|---|
| Средний Exact-Match Score (7 датасетов) | 0.326 |
| Преимущество над базовой линией IGPO | +0.053 |
| Требования к инфраструктуре | Нет внешних моделей/верификаторов |
| Дата публикации (arXiv) | 15 июля 2026 |
Почему это важно
LAPO демонстрирует, что ретроспективная атрибуция, основанная на самом полиси, может эффективно заменять сложные системы оценки. Это снижает вычислительные затраты и упрощает пайплайн обучения агентов, способных к сложному логическому поиску в базах знаний.
Источник: arXiv cs.AI ↗
