Прорыв в онлайн-обучении агентов
Команда исследователей во главе с Мяньцю Хуангом представила EvoCUA-1.5, архитектуру, решающую ключевую проблему компьютерных агентов: переход от статического офлайн-обучения к динамическому онлайн-взаимодействию. В отличие от имитационного обучения, новая система использует Step-Level Policy Optimization (STEPO), позволяя агентам учиться на верифицируемых результатах в исполняемых песочницах, где каждое действие меняет состояние экрана и доступные опции.
Технические инновации: STEPO и DTAC
Для преодоления проблем разреженных наград и длинных траекторий внедрены два ключевых механизма:
- STEPO (Step-Level Policy Optimization): Сохраняет баланс преимущества на уровне траектории даже при декомпозиции на отдельные шаги.
- DTAC (Dynamic Tri-Adaptive Curriculum): Динамическая программа обучения, сочетающая обучаемые задачи, повторное воспроизведение сложных успешных сценариев и контролируемое воздействие невыполнимых задач для устойчивости.
Результаты бенчмарков
Эксперименты показали, что EvoCUA-1.5 достигает успеха в 63.2% случаев на наборе данных OSWorld-Verified. Это превосходит открытые модели базового уровня (32B/35B параметров) и сопоставимо с более крупными аналогами. Ниже приведено сравнение эффективности:
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| EvoCUA-1.5 (OSWorld-Verified) | 63.2% | Основной результат исследования |
| Базовые модели (32B/35B) | Ниже 63.2% | Превзойдены EvoCUA-1.5 |
| Крупные проприетарные модели | Сопоставимо | Приближение к уровню больших моделей |
Инфраструктура и значимость
Система использует полностью асинхронную инфраструктуру RL с контролем «устаревания» (staleness control) и мини-групповым батчингом, что обеспечивает стабильность обучения. Публикация от 7 июля 2026 года открывает путь к масштабированию онлайн-обучения для агентов, работающих в частично наблюдаемых мультимодальных средах.
Источник: arXiv cs.AI ↗
