AI-новости25 марта 2026 г., 12:22 МСК

MolmoWeb от AI2: браузерный web-агент с открытыми весами, 30 000 траекторий и меньше черного ящика

Фото новости

AI2 выпустила MolmoWeb, открытый visual web-агент на 4B и 8B параметрах. Модель работает с браузерными скриншотами и сама выполняет действия. К релизу добавлен датасет MolmoWebMix с 30 000 человеческих траекторий.

Новый релиз важен, потому что появляется путь между закрытыми API и пустыми open-weight фреймворками.

Проще: теперь можно видеть, как агент учится, и проверять, почему он сделал тот или иной клик.

Пробел закрылся: теперь есть «средний путь» между закрытой магией и ручным склеиванием

\n
Карточка релиза MolmoWeb: модели 4B/8B, датасет 30K human task trajectories, 590K подзадач и 2.2M screenshot Q&A
Скриншот: venturebeat.com
\n

Раньше рынок давил на два варианта. Первые — закрытые API, где вы не видите, как принимаются решения. Вторые — open-weight фреймворки, где модели под задачу нужно строить сами.

MolmoWeb убирает эту развязку. Вы получаете уже обученный визуальный агент с датасетом и pipeline, то есть не ноль по старту.

Важно для практики: это меньше экспериментов ради запуска и больше управляемый результат, особенно для команд, где нужен контроль, а не магия.

Что реально изменилось: как агент теперь действует, а не просто описывает экран

Сервис делает не просто captioning (подпись изображения), а chain of actions (цепочку действий) по браузеру. На вход он берет задание, скриншот, лог прошлого шага и URL.

Потом пишет reasoning (логическое мышление) в естественном языке и выбирает следующий шаг: клик, ввод текста, скролл, переход или смену вкладки.

  • Работа только со скриншотами, без чтения HTML дерева страницы.
  • Поддержка Chrome, Safari или облачного браузера как источника экрана.
  • Модель может запускаться локально или через облачный сервис Browserbase.
  • Не требуется привязка к конкретному accessibility tree (дерево доступности), что упрощает интеграцию.
  • 4B/8B режимы: выбор мощности под бюджет и скорость.
  • Обучение на 30 000 человеческих траекторий по 1 100 сайтам.
  • Более 590 000 демонстраций подзадач для детализации поведения.
  • 2,2 млн пар screenshot Q&A для точного чтения интерфейсов.
  • Дополнение синтетическими траекториями для расширения редких сценариев.
  • Сравнение в 4 benchmark (тестах производительности): WebVoyager, Online-Mind2Web, DeepShop, WebTailBench.

Технически это не «чудо-агент». Это скорее инструмент, который учится на реальных маршрутах и работает на их основе.

Слабые места тоже открыты: OCR (распознавание текста) иногда дает ошибки, drag-and-drop нестабилен, а сложные неоднозначные инструкции бьют по точности.

Зачем это сделали и что стоит за новым релизом: вопрос не про красивую демо, а про контроль и стоимость

AI2 явно играет на поле воспроизводимости. Команда поставила акцент: если можно собрать траекторию, можно переучить агент под свой процесс.

Для бизнеса это означает не просто «получил API и молишься». Это управление через проверяемый пайплайн и аудит изменений.

Ваша компания в таком подходе выигрывает в трех местах.

  • Прозрачность: можно проверять, как агент учится и почему делает шаги так.
  • Адаптивность: модель можно fine-tune (дообучение), если нужны внутренние процессы.
  • Снижение зависимости от per-call API расходов с ростом объемов автоматизации.
  • Сроки запуска: меньше времени на сборка собственной агентной логики.

Почему это важно теперь: в команде растет число рутинных браузерных задач, от мониторинга цен до отчетности по сайтам. И они почти не дают эффекта, пока выполняются медленно и вручную.

MolmoWeb дает возможность превратить эти задачи в повторяемый поток, где каждое действие можно документировать и повторить.

Как применить прямо сейчас: 3 сценария, где эффект будет заметен за 1–2 недели

Первый шаг — не запускать сразу на всем предприятии. Берите один четкий процесс и считаете выигрыш до и после.

  • Сценарий 1: мониторинг обновлений цен на сайтах конкурентов; уменьшаете ручной заход и забывчивые ошибки.
  • Сценарий 2: поддержка тестовых касаний в интерфейсе партнерской платформы, где шаги повторяются ежедневно.
  • Сценарий 3: сбор данных для аналитики при неизменяемой структуре страниц и регулярном паттерне навигации.

Дальше добавьте расчет экономии. Сравните:

  • время до первого правильного результата в ручном режиме;
  • время после запуска MolmoWeb;
  • доли ручных исправлений из-за неверного чтения текста.

Если ваша задача требует логинов, платежей или сложных капчи, сейчас это зона риска. Тут пока лучше не переносить критические процессы целиком.

Официальный материал с деталями релиза: тут.

Неожиданно: AI-веб-агенты уходят от логики «готовая модель — закрытый результат» к логике «процесс можно копать, считать и дообучать». Это уже не просто автоматизация, а новый тип инженерии операций, где контролируемая прозрачность важнее громких обещаний.