Прорыв в универсальности GUI-агентов
Команда Venus (Venus Team) опубликовала технический отчет о модели UI-Venus-2. Это не просто еще один benchmark-решатель, а фундаментальный агент общего назначения, способный работать в едином замкнутом контуре «рассуждение-действие» (reasoning-action framework). Главная цель проекта — преодолеть разрыв между тестовыми средами и реальным миром, где агенты часто терпят неудачу из-за хрупкости задач и отсутствия надежной проверки результатов.
Масштабирование по трем ключевым измерениям
Авторы подчеркивают, что успех UI-Venus-2 обусловлен совместным масштабированием трех критических параметров:
- Окружение (Environments): Покрытие расширено до более чем 170 мультиязычных мобильных приложений и нативных десктопных операционных систем. Это позволяет агенту взаимодействовать с реальным софтом, а не только с симуляторами.
- Задачи (Tasks): Используется пайплайн глубокого исследования (deep-research) для генерации инструкций, привязанных к конкретным функциям (function-grounded), что повышает релевантность обучения.
- Верификация (Verification): Внедрены оценщики уровня трассировки (trace-level) и уровня образца (sample-level). Ключевая инновация — использование визуальных ключевых точек (visual keypoints) и голосования нескольких моделей (multi-model voting) для генерации надежных сигналов для обучения с подкреплением (RL).
Безопасность и надежность
Важным аспектом разработки стала интеграция механизмов, осведомленных о безопасности (safety-aware mechanisms). Это обеспечивает контролируемое выполнение действий, имеющих последствия (consequential actions), что критично для внедрения агентов в реальные пользовательские сценарии без риска повреждения данных или систем.
Сравнительные характеристики и архитектура
UI-Venus-2 позиционируется как open-source решение, сочетающее способность, эффективность и обобщаемость. Ниже приведена сводка ключевых технических особенностей модели:
| Параметр | Характеристика UI-Venus-2 |
|---|---|
| Тип агента | Мультимодальный GUI-агент общего назначения |
| Поддерживаемые платформы | Мобильные ОС, Веб, Десктоп (нативные ОС) |
| Покрытие приложений | > 170 мультиязычных мобильных приложений |
| Метод обучения | RL с сигналами от верификаторов (trace/sample level) |
| Механизм верификации | Визуальные ключевые точки + Multi-model voting |
| Безопасность | Механизмы контроля критических действий |
| Статус | Open-source foundation |
Работа опубликована 27 августа 2026 года в arXiv (cs.AI). Авторы утверждают, что UI-Venus-2 продвигает поле к созданию более обобщаемых, верифицируемых и саморефлексивных агентов, готовых к реальным приложениям.
Источник: arXiv cs.AI ↗
