AI2 выпустила MolmoWeb, открытый visual web-агент на 4B и 8B параметрах. Модель работает с браузерными скриншотами и сама выполняет действия. К релизу добавлен датасет MolmoWebMix с 30 000 человеческих траекторий.
Новый релиз важен, потому что появляется путь между закрытыми API и пустыми open-weight фреймворками.
Проще: теперь можно видеть, как агент учится, и проверять, почему он сделал тот или иной клик.
Пробел закрылся: теперь есть «средний путь» между закрытой магией и ручным склеиванием
\n
Раньше рынок давил на два варианта. Первые — закрытые API, где вы не видите, как принимаются решения. Вторые — open-weight фреймворки, где модели под задачу нужно строить сами.
MolmoWeb убирает эту развязку. Вы получаете уже обученный визуальный агент с датасетом и pipeline, то есть не ноль по старту.
Важно для практики: это меньше экспериментов ради запуска и больше управляемый результат, особенно для команд, где нужен контроль, а не магия.
Что реально изменилось: как агент теперь действует, а не просто описывает экран
Сервис делает не просто captioning (подпись изображения), а chain of actions (цепочку действий) по браузеру. На вход он берет задание, скриншот, лог прошлого шага и URL.
Потом пишет reasoning (логическое мышление) в естественном языке и выбирает следующий шаг: клик, ввод текста, скролл, переход или смену вкладки.
- Работа только со скриншотами, без чтения HTML дерева страницы.
- Поддержка Chrome, Safari или облачного браузера как источника экрана.
- Модель может запускаться локально или через облачный сервис Browserbase.
- Не требуется привязка к конкретному accessibility tree (дерево доступности), что упрощает интеграцию.
- 4B/8B режимы: выбор мощности под бюджет и скорость.
- Обучение на 30 000 человеческих траекторий по 1 100 сайтам.
- Более 590 000 демонстраций подзадач для детализации поведения.
- 2,2 млн пар screenshot Q&A для точного чтения интерфейсов.
- Дополнение синтетическими траекториями для расширения редких сценариев.
- Сравнение в 4 benchmark (тестах производительности): WebVoyager, Online-Mind2Web, DeepShop, WebTailBench.
Технически это не «чудо-агент». Это скорее инструмент, который учится на реальных маршрутах и работает на их основе.
Слабые места тоже открыты: OCR (распознавание текста) иногда дает ошибки, drag-and-drop нестабилен, а сложные неоднозначные инструкции бьют по точности.
Зачем это сделали и что стоит за новым релизом: вопрос не про красивую демо, а про контроль и стоимость
AI2 явно играет на поле воспроизводимости. Команда поставила акцент: если можно собрать траекторию, можно переучить агент под свой процесс.
Для бизнеса это означает не просто «получил API и молишься». Это управление через проверяемый пайплайн и аудит изменений.
Ваша компания в таком подходе выигрывает в трех местах.
- Прозрачность: можно проверять, как агент учится и почему делает шаги так.
- Адаптивность: модель можно fine-tune (дообучение), если нужны внутренние процессы.
- Снижение зависимости от per-call API расходов с ростом объемов автоматизации.
- Сроки запуска: меньше времени на сборка собственной агентной логики.
Почему это важно теперь: в команде растет число рутинных браузерных задач, от мониторинга цен до отчетности по сайтам. И они почти не дают эффекта, пока выполняются медленно и вручную.
MolmoWeb дает возможность превратить эти задачи в повторяемый поток, где каждое действие можно документировать и повторить.
Как применить прямо сейчас: 3 сценария, где эффект будет заметен за 1–2 недели
Первый шаг — не запускать сразу на всем предприятии. Берите один четкий процесс и считаете выигрыш до и после.
- Сценарий 1: мониторинг обновлений цен на сайтах конкурентов; уменьшаете ручной заход и забывчивые ошибки.
- Сценарий 2: поддержка тестовых касаний в интерфейсе партнерской платформы, где шаги повторяются ежедневно.
- Сценарий 3: сбор данных для аналитики при неизменяемой структуре страниц и регулярном паттерне навигации.
Дальше добавьте расчет экономии. Сравните:
- время до первого правильного результата в ручном режиме;
- время после запуска MolmoWeb;
- доли ручных исправлений из-за неверного чтения текста.
Если ваша задача требует логинов, платежей или сложных капчи, сейчас это зона риска. Тут пока лучше не переносить критические процессы целиком.
Официальный материал с деталями релиза: тут.
Неожиданно: AI-веб-агенты уходят от логики «готовая модель — закрытый результат» к логике «процесс можно копать, считать и дообучать». Это уже не просто автоматизация, а новый тип инженерии операций, где контролируемая прозрачность важнее громких обещаний.
