Исследования8 июля 2026 г., 13:16 МСК🤖 Auto

TurnOPD: Как ускорить обучение агентов ИИ на 30% без потери качества

Исследователи представили TurnOPD — метод, устраняющий неэффективность он-полити дистилляции (OPD) для длинных сценариев, повышая точность и экономя вычислительное время.

Баннер новости 3103

Проблема длинных горизонтов в обучении агентов

Он-полити дистилляция (On-Policy Distillation, OPD) — мощный метод, где модель-студент обучается, подражая действиям более сильной модели-учителя на собственных траекториях. Однако при работе с длинными горизонтами (long-horizon tasks), где агент совержает множество шагов, классический OPD сталкивается с двумя критическими проблемами:

  • Потеря ресурсов на «хвостовых» ходах: Полные прогнозы (full-horizon rollouts) часто тратят время на поздние шаги, которые дают слабый и зашумленный сигнал KL-дивергенции.
  • Неравномерное обучение: Объектив KL на уровне траектории концентрирует большую часть ошибки на ранних, поверхностных токенах, оставляя глубокие решения недостаточно обученными после начального выравнивания поведения.

Решение: TurnOPD

Авторы (Юхан Чжоу, Кай Чжэн и соавторы) предлагают TurnOPD — стратегию распределения бюджета на уровне отдельных ходов (turns). Метод включает два контроллера бюджета:

  1. Адаптивная глубина прогона (Adaptive rollout-depth budgeting): Использует статистику по ходам для определения оптимальной длины прогона, отсекая избыточные шаги.
  2. Прогрессивное нормализованное распределение потерь (Progressive turn-normalized loss budgeting): Постепенно смещает вес KL от токенов к сбалансированному контролю по ходам, обеспечивая равномерное обучение всех этапов принятия решений.

Результаты бенчмарков

Эксперименты проводились на трех ключевых задачах с использованием специализированных моделей-учителей. TurnOPD демонстрирует превосходство по точности валидации при равных бюджетах машинного времени (wall-clock time) по сравнению с базовым OPD.

Бенчмарк Задача Ключевое преимущество TurnOPD
ALFWorld Взаимодействие с виртуальной средой Выше точность при том же времени обучения
WebShop Поиск и покупка товаров Эффективное использование вычислительных ресурсов
Multi-Hop Search Многоступенчатый поиск информации Улучшение соотношения точность/время

Почему это важно

TurnOPD продвигает границу «точность-время» (accuracy–time frontier) для агентов с длинным горизонтом. Это означает, что разработчики могут обучать более умных и сложных AI-ассистентов за меньшее время и с меньшими затратами на GPU, что критически важно для коммерческого внедрения автономных агентов.

Источник: arXiv cs.AI ↗