Конец эры «кликов»
Традиционные AI-агенты для веба работают по принципу пошагового взаимодействия: модель анализирует экран и выбирает одно действие (клик, ввод текста). Этот подход часто приводит к накоплению ошибок на длинных дистанциях задач. Microsoft Research предлагает альтернативу: Webwright — система, которая дает модели доступ к терминалу и заставляет её писать программный код.
Результаты на базе GPT-5.4
Ключевое преимущество подхода — переход от хрупких последовательностей кликов к устойчивым скриптам. В тестах на длинных горизонтах задач (long-horizon tasks) использование той же модели GPT-5.4 показало значительный скачок эффективности. Вместо того чтобы оставлять после себя «след кликов», агент генерирует переиспользуемый инструмент командной строки.
Сравнение эффективности
Разница в подходах видна в метриках успешности выполнения задач. Ниже приведены ключевые показатели, демонстрирующие преимущество генерации кода над имитацией действий:
| Метрика | Традиционный подход (Click-based) | Webwright (Code-based) |
|---|---|---|
| Успешность задач | 33.5% | 60.1% |
| Основа модели | GPT-5.4 | GPT-5.4 |
| Результат работы | След кликов (непереиспользуемый) | Командный скрипт (переиспользуемый) |
Почему это важно
Генерация кода решает проблему накопления ошибок. Если агент ошибается в одном клике, вся цепочка может развалиться. Скрипт же можно отладить, запустить заново или интегрировать в другие процессы. Webwright доказывает, что для сложных веб-задач AI должен действовать как разработчик, а не как пользователь, тыкающий мышкой.
Источник: Towards Data Science ↗
