Исследования24 сентября 2026 г., 09:20 МСК🤖 Auto

RLDS: Разложение на подзадачи ускоряет обучение агентов

Исследователи представили RLDS — метод, который заменяет единый скалярный reward в GRPO на оценку по подзадачам, обеспечивая прирост до +11.5 баллов на сложных задачах.

Баннер новости 8166

Проблема скалярного вознаграждения

Традиционные методы оптимизации политик, такие как Group Relative Policy Optimization (GRPO), сводят весь многошаговый роутлинг к одному скалярному значению награды. При обучении агентов, выполняющих сложные задачи, это приводит к потере информации: оптимизатор не может точно определить, какое именно действие или навык привели к результату, особенно при разреженных и отложенных сигналах обратной связи.

Решение: RLDS и SDAE

Авторы предлагают метод Reinforcement Learning with Decomposed Subtasks (RLDS). Его ядро — Subtask-Decomposed Advantage Estimation (SDAE). Вместо единой оценки, метод:

  • Разбивает награду траектории на доли по фиксированной таксономии подзадач.
  • Вычисляет групповую относительную выгоду (advantage) для каждой подзадачи.
  • Распределяет кредит по токенам, взвешивая выгоду подзадачи по её важности и концентрируя её вокруг шага, где отражение (reflection) помечает выполнение как ключевое.

Результаты на бенчмарках

Эксперименты проводились на четырех агентных бенчмарках. Наибольший прирост показан на задачах с высокой гетерогенностью навыков:

Бенчмарк Описание Прирост (RLDS vs GRPO) Статистическая значимость
ScienceWorld Долгосрочная эмбеддированная наука +11.5 баллов 95% CI [+9.8, +13.3]
FrozenLake Спарсная навигация по сетке +9.8 баллов 95% CI [+7.0, +12.8]
HotpotQA Многошаговый QA (1 инструмент) В пределах шума —
DeepResearch Долгое исследование (4 инструмента) В пределах шума —

Эффективность вычислений

На задаче ScienceWorld метод RLDS оказался более эффективным по вычислениям: время выполнения одного шага сократилось на 10.9% по сравнению со скалярным GRPO. Это достигается за счет того, что длинные роутлинги амортизируют фикрованные накладные расходы на рефлексию и оценку.

Вывод

Метод показывает, что декомпозиция награды на подзадачи критически важна для задач с высокой гетерогенностью навыков, где традиционные скалярные методы теряют сигнал.

Источник: arXiv cs.AI ↗