В мире искусственного интеллекта мы привыкли слышать о прорывах в генерации изображений, текстов или кода. Однако существует еще одна, не менее амбициозная область — создание агентов, способных самостоятельно управлять интерфейсами пользователя. Эти так называемые Computer-Use Agents (CUA) должны уметь кликать, печатать, перетаскивать окна и выполнять сложные сценарии в операционных системах, браузерах и мобильных приложениях. Но до недавнего времени эта область страдала от фрагментации: исследователи и разработчики тратили недели на то, чтобы заставить свои модели работать с разными средами, парсить разрозненные датасеты и настраивать сложные инфраструктуры тестирования.
Команда исследователей из Калифорнийского университета в Беркли (UC Berkeley) представила решение, которое может стать фундаментом для всей индустрии агентов. Их проект — CUA-Lite — это не просто еще одна библиотека, а полноценная инфраструктурная платформа. Она объединяет агентов, среды выполнения (окружения), данные (траектории) и инструменты оценки под одним действием, одной схемой данных и одной командой. Это позволяет запускать тесты и обучение как на десктопах, так и в браузерах и мобильных устройствах, используя единый интерфейс.
В этой статье мы подробно разберем, как CUA-Lite решает проблему «налога на виртуализацию», почему его архитектура важна для локального запуска AI-моделей в России и как исследователи достигли паритета точности между контейнерами Docker и полноценными виртуальными машинами.
01Проблема фрагментации: почему старые подходы не работают
Аргумент, стоящий за созданием CUA-Lite, носит инфраструктурный, а не модельный характер. Для того чтобы эффективно обучать и бенчмаркать (тестировать) агента, управляющего компьютером, необходимы четыре ключевых компонента:
- Агенты (Agents): Сама модель или система, принимающая решения.
- Среды (Environments): Окружение, в котором агент действует (например, эмуляция рабочего стола Ubuntu или браузера Chrome).
- Траектории (Traces): Записи действий агента и состояний среды, необходимые для обучения.
- Фреймворк оценки и обучения: Инструменты, которые измеряют успех агента и обновляют его веса.
Проблема заключается в том, что до появления CUA-Lite эти четыре компонента были разбросаны по разным репозиториям с несовместимыми интерфейсами. Исследователю приходилось писать кастомные адаптеры для каждой новой среды, конвертировать данные из одного формата в другой и настраивать уникальные скрипты для каждого типа задачи. Это создавало огромные барьеры для входа и замедляло прогресс в области.
CUA-Lite ломает эту стену. Платформа предлагает единое пространство действий (action space), единую схему данных и универсальную команду для запуска. Это означает, что исследователь может переключиться с тестирования агента в браузере на тестирование того же агента в мобильном приложении, изменив всего одну переменную в конфигурации, а не переписывая половину кодовой базы.
02Lite.OSWorld: Устранение «налога на виртуализацию»
Самым конкретным и технически значимым вкладом CUA-Lite является проект Lite.OSWorld. Чтобы понять его важность, нужно рассмотреть проблему, которую решает стандартный OSWorld. OSWorld — это популярный набор задач для тестирования агентов, который предоставляет верификабельную среду рабочего стола Ubuntu. Однако традиционная реализация OSWorld использует полноценные виртуальные машины QEMU/KVM для каждой задачи.
Это создает серьезную проблему, известную как «налог на виртуализацию» (VM tax). Запуск полноценной VM требует ресурсов хост-машины, включая доступ к аппаратной виртуализации (/dev/kvm). Большинство облачных инстансов, CI-раннеров (систем непрерывной интеграции) и даже локальных серверов не предоставляют доступ к вложенной виртуализации (nested virtualization) из-за соображений безопасности и производительности. В результате исследователи не могут легко масштабировать тестирование, запуская сотни задач параллельно.

Команда CUA-Lite решила эту проблему, воспроизведя тот же набор задач и те же оценщики (evaluators) внутри обычного контейнера Docker с рабочим столом GNOME. Они сохранили функциональную идентичность, но убрали необходимость в KVM. Давайте посмотрим на сравнительные данные, которые демонстрируют эффективность этого подхода:
Сравнение производительности: OSWorld против Lite.OSWorld
Разница в потреблении ресурсов и скорости запуска поражает. Вот как выглядят ключевые метрики:
- Среда выполнения: OSWorld использует QEMU/KVM VM, тогда как Lite.OSWorld — это контейнер Docker.
- Требования к хосту: OSWorld требует
/dev/kvmи вложенной виртуализации. Lite.OSWorld работает на любом хосте с Docker. - Потребление памяти: OSWorld требует 4.1 ГБ оперативной памяти на задачу. Lite.OSWorld обходится всего 0.9 ГБ. Это снижение более чем в 4 раза.
- Время холодного старта (Cold start): Запуск VM занимает 29.9 секунд. Запуск контейнера — 23.8 секунды. Хотя разница не кажется огромной, в масштабах тысяч задач это экономит часы вычислений.
- Параллелизм: Благодаря меньшему потреблению памяти, Lite.OSWorld позволяет запускать примерно в 4.6 раза больше экземпляров задач одновременно по сравнению с базовым уровнем OSWorld.
Эти цифры делают массовое обучение и тестирование агентов экономически и технически целесообразным. То, что раньше требовало кластера серверов с поддержкой KVM, теперь можно запустить на стандартном облачном инстансе.
03Верификация точности: контейнеры против виртуальных машин
Естественный вопрос, который возникает при замене виртуальной машины на контейнер: не теряем ли мы точность? Контейнеры изолируют процессы, но они не являются полноценной операционной системой. Может ли эмуляция рабочего стола внутри Docker так же точно отражать поведение агента, как и в полноценной VM?
Команда исследователей из UC Berkeley подошла к этому вопросу напрямую. Они провели сравнительный анализ, протестировав 13 различных моделей агентов как в оригинальной среде OSWorld (на VM), так и в Lite.OSWorld (в Docker). Результаты оказались удивительно согласованными: оценки, полученные в контейнере, полностью совпадают с оценками, полученными в виртуальной машине.
Это означает, что сигнал обучения (training signal), полученный в легкой среде Lite.OSWorld, полностью переносим на реальный бенчмарк. Исследователь может обучать модель на тысячах задач в быстрых контейнерах, зная, что результаты будут релевантны для официальных тестов OSWorld. Это устраняет главное опасение, связанное с использованием эмуляции.
На базе этой легкой среды теперь формируется целое семейство песочниц:

- Lite.ScaleCUA: Для масштабирования задач.
- Lite.CUAGym: Стандартный интерфейс Gym для обучения с подкреплением.
- Lite.CUAWorld: Расширенная среда, включающая около 40 приложений, таких как Blender, QGIS и VS Code. Это позволяет тестировать агентов не только на базовых задачах, но и на сложном профессиональном ПО.
В общей сложности платформа предлагает более 30 000 верифицируемых задач, что является огромным корпусом данных для обучения AI.
04Единая схема данных: LiteSample
Вторая ключевая инновация CUA-Lite — это слой данных. До сих пор каждый проект по обучению агентов использовал свой собственный формат хранения данных: одни использовали JSON, другие CSV, третьи — специфические бинарные форматы. Это делало невозможным простое объединение датасетов для обучения.
CUA-Lite вводит LiteSample — единую схему данных для обучения с учителем (supervised learning). Эта схема универсальна для всех сред, агентов и типов задач. Данные хранятся в виде простых файлов Parquet (высокопроизводительный формат колоночных данных) вместе с изображениями экранов. Такой подход обеспечивает высокую скорость чтения и совместимость с современными инструментами анализа данных.
Исследователи уже предобработали более 10 существующих датасетов CUA и опубликовали их бесплатно на платформе Hugging Face. Среди них:
- Aguvis
- OpenCUA
- ScaleCUA
- GUI-360
- GUIOdyssey
- Multimodal-Mind2Web
Помимо этих исторических данных, платформа предлагает свежие rollout datasets (данные разворота). Они генерируются путем прогона передовых моделей-учителей (teacher models) через песочницы CUA-Lite. Эти данные затем можно использовать для дистилляции знаний в более маленькие и быстрые модели-студенты. Это критически важно для создания эффективных агентов, которые могут работать локально, не требуя огромных вычислительных ресурсов.
LiteSample в формат, понятный конкретной модели, включая оптимизацию, такую как «схлопывание истории» (history collapsing), чтобы несколько шагов могли обрабатываться за один прямой проход (forward pass).05Обучение и оценка одной командой
Агенты и среды встречаются в модуле lite.gym. Принцип прост: на вход подаются скриншоты, на выходе получаются действия. При этом используется единое пространство действий для каждой платформы (десктоп, браузер, мобильный).

Платформа уже интегрирует более 10 агентов, включая модели на базе GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и других. Также интегрировано более 15 бенчмарков, охватывающих:
- Grounding (Привязка к экрану): ScreenSpot-Pro, OSWorld-G.
- Десктоп: OSWorld, OSWorld-2, WindowsAgentArena, CUABench.
- Браузер: WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym.
- Мобильные: AndroidWorld, AndroidLab, MobileWorld, MobileGym.
Интерфейс взаимодействия минималистичен. Чтобы запустить тестирование или обучение, достаточно изменить параметры --model-id и --env-id в скрипте scripts/rollout.py. Это снижает порог входа для новых исследователей.
Практические результаты обучения
Один и тот же цикл используется как для оценки, так и для обучения. Рассмотрим пример обучения с учителем (SFT). В документации README описан процесс тонкой настройки модели Qwen3-VL-2B-Instruct на траекториях рабочего стола из Lite.ScaleCUA.
Результаты впечатляют: средняя доходность эпизода (mean episode return) на наборе из 332 задач в оценке lite.osworld выросла с 0.138 до 0.237. Важно отметить, что этот результат получен при использовании всего одной конфигурации на двух GPU. Это демонстрирует, что даже небольшие модели могут показывать значительный прогресс при наличии качественных данных и правильной инфраструктуры.
Для обучения с подкреплением (RL) используются траектории, оцененные в среде, для обновления GRPO (Group Relative Policy Optimization) поверх архитектуры Slime. Приведен рабочий пример для MobileGym, охватывающий 416 мобильных задач в 28 приложениях. Это показывает, что платформа готова к сложным сценариям обучения, где агент должен учиться на основе вознаграждения, а не только на готовых примерах.
06Как запустить CUA-Lite: практическое руководство
Один из главных вопросов для любого разработчика: «Насколько легко это развернуть?». Ответ от команды UC Berkeley — очень легко. Стек устанавливается стандартными инструментами Python.
Для установки всех зависимостей и дополнительных модулей достаточно выполнить команду:

uv sync --all-extrasТребуется Python версии 3.12 или выше. Легкие песочницы работают на любом хосте Docker без необходимости в /dev/kvm. Это означает, что вы можете запустить CUA-Lite на:
- Облачных инстансах (AWS, GCP, Azure, а также российских облаках, таких как Yandex Cloud или Selectel).
- CI-раннерах (GitHub Actions, GitLab CI).
- Вложенных контейнерах (Docker in Docker).
- Локальных машинах с установленным Docker Desktop.
Это делает платформу идеальной для интеграции в процессы разработки и непрерывного тестирования. Вы можете автоматически запускать регрессионные тесты для ваших AI-агентов каждый раз при изменении кода.
07Что это значит на практике
Появление CUA-Lite знаменует собой переход от разрозненных экспериментов к стандартизированной инженерной практике в области AI-агентов. Вот три ключевых вывода для разработчиков и исследователей:
- Демократизация доступа к мощным средам. Благодаря отказу от KVM и переходу на Docker, сложные задачи по управлению ОС теперь доступны на любом оборудовании. Это открывает двери для исследователей из стран с ограниченным доступом к высокопроизводительному оборудованию с поддержкой вложенной виртуализации, включая многие регионы России.
- Ускорение итераций. Снижение потребления памяти в 4.6 раза и ускорение запуска позволяют проводить больше экспериментов за меньшее время. В эпоху, когда скорость итераций определяет успех проекта, это критическое преимущество.
- Унификация данных. Наличие единой схемы
LiteSampleи готовых датасетов на Hugging Face позволяет исследователям сосредоточиться на улучшении архитектуры моделей, а не на написании скриптов для парсинга данных. Это ускоряет внедрение новых моделей, таких как Qwen3-VL или UI-TARS, в реальные задачи.
CUA-Lite — это не просто еще один инструмент. Это инфраструктурный фундамент, который может стать стандартом де-факто для разработки агентов, управляющих компьютером. Объединяя агентов, среды, данные и обучение в единую экосистему, UC Berkeley закладывает основу для следующего поколения интеллектуальных помощников, способных работать с любым программным обеспечением.
Для тех, кто хочет углубиться в тему, доступны страница проекта, репозиторий на GitHub и датасеты на Hugging Face. Рекомендуется начать с изучения документации по Lite.OSWorld и попытки запустить первый rollout с использованием открытых моделей, таких как Qwen3-VL. Это отличный способ оценить потенциал платформы на практике.
08Заключение
Развитие AI-агентов находится на критическом этапе. Переход от простых чат-ботов к автономным агентам, способным выполнять сложные задачи в цифровых средах, требует надежной инфраструктуры. CUA-Lite от UC Berkeley предоставляет именно такую основу, устраняя технические барьеры и унифицируя процессы. Сочетание высокой производительности, простоты развертывания и богатого набора данных делает эту платформу обязательным инструментом для всех, кто занимается разработкой Computer-Use Agents.
Следите за обновлениями проекта, экспериментируйте с новыми датасетами и будьте в авангарде развития агентного ИИ.
Источник: MarkTechPost ↗
