Проблема коротких демо и реального веба
Большинство существующих браузерных агентов демонстрируют отличные результаты на коротких, чистых демонстрациях. Однако в реальных условиях они сталкиваются с фундаментальными проблемами: необходимость принимать десятки решений на живых сайтах, восстанавливаться после ошибок и ориентироваться в сложных пользовательских интерфейсах. Авторы статьи из AIMAE (Alibaba) утверждают, что масштабирование моделей недостаточно — требуется выравнивание на всех уровнях пайплайна: исполнении, надзоре, оптимизации и оценке.
Три ключевых技术创新
Для решения этих задач команда разработала унифицированную фреймворковую структуру Wuying-Browser-Agent, включающую три инновационных компонента:
- Структурированный браузерный хаб (Browser Harness): Обеспечивает стабильные примитивы выполнения и управление контекстом, ориентированным на принятие решений.
- RUIC-SFT (Reflection and UI-specialized Curriculum SFT): Специализированное обучение с учителем, которое явно тренирует модель на траекториях восстановления после ошибок и взаимодействии со сложными UI.
- DAO-GRPO (Divergence-Aware Online GRPO): Метод оптимизации, улучшающий распределение кредита на длинных горизонтах (long-horizon credit assignment) за счет потенциального формирования награды и взвешивания шагов с учетом дивергенции.
Новый бенчмарк BrowserBench
Авторы отмечают, что существующие бенчмарки слишком короткие, чтобы выявить проблемы долгосрочного планирования. В ответ на это они представили BrowserBench — двуязычный (английский/китайский) набор данных из 350 задач, средняя длина которых составляет 37,9 шагов. Это позволяет тестировать агентов на реальных сценариях, требующих устойчивости к ошибкам.
Результаты и сравнение
Модель Wuying-Browser-Agent-27B установила новые рекорды для open-source решений на ключевых бенчмарках. Ниже приведены сравнительные метрики производительности:
| Бенчмарк | Результат Wuying-Browser-Agent-27B | Значимость |
|---|---|---|
| WebVoyager | 80.6% | Новый open-source SOTA |
| Online-Mind2Web | 66.7% | Высокая точность в динамической среде |
| BrowserBench (собственный) | 65.1% | Успешное выполнение долгих сессий |
| Средний балл (Tau2, Claw-Eval, BFCL-v4) | 73.8 | Доказательство общей агентной способности |
Интересно, что предложенный пайплайн не ограничивается только браузером. Модель продемонстрировала сильную общую агентную способность, показав средний балл 73.8 на комплексных тестах Tau2-Bench, Claw-Eval и BFCL-v4, что подтверждает универсальность подхода к обучению долгосрочному планированию.
Источник: arXiv cs.AI ↗
