Проблема существующих методов
Групповая относительная оптимизация политик (GRPO) стала стандартом для обучения агентов на базе больших языковых моделей (LLM) в интерактивных задачах. Однако текущие подходы имеют критический недостаток: они не различают качество успешных траекторий, если те приводят к одному и тому же результату. Например, «зигзагообразный» успех, требующий множества лишних шагов, получает ту же награду, что и оптимальное решение. Это вызывает коллапс преимуществ (advantage collapse) и создает серьезный барьер для производительности.
Решение: PlanPO
Команда авторов (Dayang Liang, Liyuan He, Xuan Feng и др.) предложила метод Group Planning-aware Policy Optimization (PlanPO). Ключевая инновация заключается во введении сигналов преимуществ «от грубого к тонкому» (coarse-to-fine). Метод учитывает:
- Различия в длине траектории на уровне всего взаимодействия.
- Различия в длине ответов на каждом отдельном шаге (turn-level).
Это позволяет агенту учиться не просто минимизировать длину ответа (как в ванильных методах), а осознанно планировать действия, выделяя высококачественные руллеты (rollouts) без деградации модели.
Результаты бенчмарков
Эксперименты показали, что PlanPO превосходит базовый алгоритм GRPO в среднем на 27,2% на сложных многошаговых бенчмарках. При этом дополнительные затраты на обучение остаются пренебрежимо малыми.
| Бенчмарк | Описание задачи | Результат PlanPO |
|---|---|---|
| ALFWorld | Взаимодействие с виртуальной средой (ALF) | Улучшение на 27,2% vs GRPO |
| WebShop | Поиск и покупка товаров в интернет-магазине | Улучшение на 27,2% vs GRPO |
| SciWorld | Решение научных задач с использованием инструментов | Улучшение на 27,2% vs GRPO |
Значение для индустрии
PlanPO демонстрирует, что учет эффективности планирования на уровне групп траекторий критически важен для создания обобщаемых (generalizable) агентов. Метод позволяет моделям учиться осознанным действиям, охватывающим как планирование взаимодействия, так и генерацию текста, что открывает путь к более надежным автономным системам.
Источник: arXiv cs.AI ↗
