Проблема скалярного вознаграждения
Традиционные методы оптимизации политик, такие как Group Relative Policy Optimization (GRPO), сводят весь многошаговый роутлинг к одному скалярному значению награды. При обучении агентов, выполняющих сложные задачи, это приводит к потере информации: оптимизатор не может точно определить, какое именно действие или навык привели к результату, особенно при разреженных и отложенных сигналах обратной связи.
Решение: RLDS и SDAE
Авторы предлагают метод Reinforcement Learning with Decomposed Subtasks (RLDS). Его ядро — Subtask-Decomposed Advantage Estimation (SDAE). Вместо единой оценки, метод:
- Разбивает награду траектории на доли по фиксированной таксономии подзадач.
- Вычисляет групповую относительную выгоду (advantage) для каждой подзадачи.
- Распределяет кредит по токенам, взвешивая выгоду подзадачи по её важности и концентрируя её вокруг шага, где отражение (reflection) помечает выполнение как ключевое.
Результаты на бенчмарках
Эксперименты проводились на четырех агентных бенчмарках. Наибольший прирост показан на задачах с высокой гетерогенностью навыков:
| Бенчмарк | Описание | Прирост (RLDS vs GRPO) | Статистическая значимость |
|---|---|---|---|
| ScienceWorld | Долгосрочная эмбеддированная наука | +11.5 баллов | 95% CI [+9.8, +13.3] |
| FrozenLake | Спарсная навигация по сетке | +9.8 баллов | 95% CI [+7.0, +12.8] |
| HotpotQA | Многошаговый QA (1 инструмент) | В пределах шума | — |
| DeepResearch | Долгое исследование (4 инструмента) | В пределах шума | — |
Эффективность вычислений
На задаче ScienceWorld метод RLDS оказался более эффективным по вычислениям: время выполнения одного шага сократилось на 10.9% по сравнению со скалярным GRPO. Это достигается за счет того, что длинные роутлинги амортизируют фикрованные накладные расходы на рефлексию и оценку.
Вывод
Метод показывает, что декомпозиция награды на подзадачи критически важна для задач с высокой гетерогенностью навыков, где традиционные скалярные методы теряют сигнал.
Источник: arXiv cs.AI ↗
