Проблема длинных горизонтов в обучении агентов
Он-полити дистилляция (On-Policy Distillation, OPD) — мощный метод, где модель-студент обучается, подражая действиям более сильной модели-учителя на собственных траекториях. Однако при работе с длинными горизонтами (long-horizon tasks), где агент совержает множество шагов, классический OPD сталкивается с двумя критическими проблемами:
- Потеря ресурсов на «хвостовых» ходах: Полные прогнозы (full-horizon rollouts) часто тратят время на поздние шаги, которые дают слабый и зашумленный сигнал KL-дивергенции.
- Неравномерное обучение: Объектив KL на уровне траектории концентрирует большую часть ошибки на ранних, поверхностных токенах, оставляя глубокие решения недостаточно обученными после начального выравнивания поведения.
Решение: TurnOPD
Авторы (Юхан Чжоу, Кай Чжэн и соавторы) предлагают TurnOPD — стратегию распределения бюджета на уровне отдельных ходов (turns). Метод включает два контроллера бюджета:
- Адаптивная глубина прогона (Adaptive rollout-depth budgeting): Использует статистику по ходам для определения оптимальной длины прогона, отсекая избыточные шаги.
- Прогрессивное нормализованное распределение потерь (Progressive turn-normalized loss budgeting): Постепенно смещает вес KL от токенов к сбалансированному контролю по ходам, обеспечивая равномерное обучение всех этапов принятия решений.
Результаты бенчмарков
Эксперименты проводились на трех ключевых задачах с использованием специализированных моделей-учителей. TurnOPD демонстрирует превосходство по точности валидации при равных бюджетах машинного времени (wall-clock time) по сравнению с базовым OPD.
| Бенчмарк | Задача | Ключевое преимущество TurnOPD |
|---|---|---|
| ALFWorld | Взаимодействие с виртуальной средой | Выше точность при том же времени обучения |
| WebShop | Поиск и покупка товаров | Эффективное использование вычислительных ресурсов |
| Multi-Hop Search | Многоступенчатый поиск информации | Улучшение соотношения точность/время |
Почему это важно
TurnOPD продвигает границу «точность-время» (accuracy–time frontier) для агентов с длинным горизонтом. Это означает, что разработчики могут обучать более умных и сложных AI-ассистентов за меньшее время и с меньшими затратами на GPU, что критически важно для коммерческого внедрения автономных агентов.
Источник: arXiv cs.AI ↗
