Исследования20 августа 2026 г., 04:18 МСК🤖 Auto

Wuying-Browser-Agent: 27B-модель для долгих браузерных сессий

Команда AIMAE представила Wuying-Browser-Agent — первую open-source модель, способную выполнять сложные многошаговые задачи в реальном вебе. Архитектура решает проблему накопления ошибок через новые методы обучения.

Баннер новости 6124

Проблема коротких демо и реального веба

Большинство существующих браузерных агентов демонстрируют отличные результаты на коротких, чистых демонстрациях. Однако в реальных условиях они сталкиваются с фундаментальными проблемами: необходимость принимать десятки решений на живых сайтах, восстанавливаться после ошибок и ориентироваться в сложных пользовательских интерфейсах. Авторы статьи из AIMAE (Alibaba) утверждают, что масштабирование моделей недостаточно — требуется выравнивание на всех уровнях пайплайна: исполнении, надзоре, оптимизации и оценке.

Три ключевых技术创新

Для решения этих задач команда разработала унифицированную фреймворковую структуру Wuying-Browser-Agent, включающую три инновационных компонента:

  • Структурированный браузерный хаб (Browser Harness): Обеспечивает стабильные примитивы выполнения и управление контекстом, ориентированным на принятие решений.
  • RUIC-SFT (Reflection and UI-specialized Curriculum SFT): Специализированное обучение с учителем, которое явно тренирует модель на траекториях восстановления после ошибок и взаимодействии со сложными UI.
  • DAO-GRPO (Divergence-Aware Online GRPO): Метод оптимизации, улучшающий распределение кредита на длинных горизонтах (long-horizon credit assignment) за счет потенциального формирования награды и взвешивания шагов с учетом дивергенции.

Новый бенчмарк BrowserBench

Авторы отмечают, что существующие бенчмарки слишком короткие, чтобы выявить проблемы долгосрочного планирования. В ответ на это они представили BrowserBench — двуязычный (английский/китайский) набор данных из 350 задач, средняя длина которых составляет 37,9 шагов. Это позволяет тестировать агентов на реальных сценариях, требующих устойчивости к ошибкам.

Результаты и сравнение

Модель Wuying-Browser-Agent-27B установила новые рекорды для open-source решений на ключевых бенчмарках. Ниже приведены сравнительные метрики производительности:

Бенчмарк Результат Wuying-Browser-Agent-27B Значимость
WebVoyager 80.6% Новый open-source SOTA
Online-Mind2Web 66.7% Высокая точность в динамической среде
BrowserBench (собственный) 65.1% Успешное выполнение долгих сессий
Средний балл (Tau2, Claw-Eval, BFCL-v4) 73.8 Доказательство общей агентной способности

Интересно, что предложенный пайплайн не ограничивается только браузером. Модель продемонстрировала сильную общую агентную способность, показав средний балл 73.8 на комплексных тестах Tau2-Bench, Claw-Eval и BFCL-v4, что подтверждает универсальность подхода к обучению долгосрочному планированию.

Источник: arXiv cs.AI ↗