Релиз модели15 июля 2026 г., 05:17 МСК🤖 Auto

EvoCUA-1.5: Онлайн RL для агентов с точностью 63.2% на OSWorld

Исследователи представили EvoCUA-1.5 — систему онлайн-обучения с подкреплением для многошаговых компьютерных агентов, побившую аналоги масштаба 32B/35B.

Баннер новости 3594

Прорыв в онлайн-обучении агентов

Команда исследователей во главе с Мяньцю Хуангом представила EvoCUA-1.5, архитектуру, решающую ключевую проблему компьютерных агентов: переход от статического офлайн-обучения к динамическому онлайн-взаимодействию. В отличие от имитационного обучения, новая система использует Step-Level Policy Optimization (STEPO), позволяя агентам учиться на верифицируемых результатах в исполняемых песочницах, где каждое действие меняет состояние экрана и доступные опции.

Технические инновации: STEPO и DTAC

Для преодоления проблем разреженных наград и длинных траекторий внедрены два ключевых механизма:

  • STEPO (Step-Level Policy Optimization): Сохраняет баланс преимущества на уровне траектории даже при декомпозиции на отдельные шаги.
  • DTAC (Dynamic Tri-Adaptive Curriculum): Динамическая программа обучения, сочетающая обучаемые задачи, повторное воспроизведение сложных успешных сценариев и контролируемое воздействие невыполнимых задач для устойчивости.

Результаты бенчмарков

Эксперименты показали, что EvoCUA-1.5 достигает успеха в 63.2% случаев на наборе данных OSWorld-Verified. Это превосходит открытые модели базового уровня (32B/35B параметров) и сопоставимо с более крупными аналогами. Ниже приведено сравнение эффективности:

Метрика / Модель Результат Примечание
EvoCUA-1.5 (OSWorld-Verified) 63.2% Основной результат исследования
Базовые модели (32B/35B) Ниже 63.2% Превзойдены EvoCUA-1.5
Крупные проприетарные модели Сопоставимо Приближение к уровню больших моделей

Инфраструктура и значимость

Система использует полностью асинхронную инфраструктуру RL с контролем «устаревания» (staleness control) и мини-групповым батчингом, что обеспечивает стабильность обучения. Публикация от 7 июля 2026 года открывает путь к масштабированию онлайн-обучения для агентов, работающих в частично наблюдаемых мультимодальных средах.

Источник: arXiv cs.AI ↗