Проблема черного ящика в веб-агентах
Надежный мониторинг автономных веб-агентов (Web Agents) критически важен для безопасности, но часто невозможен, когда доступ к внутренним сигналам модели, таким как токеновые логиты (token logits) или уровни неопределенности, закрыт. Это особенно актуально для закрытых проприетарных моделей, где разработчики не предоставляют API для доступа к промежуточным состояниям.
Новое исследование, представленное в preprint от 2 сентября 2026 года, предлагает решение: предсказание рисков на уровне префикса (prefix-level risk prediction) исключительно на основе наблюдаемых сигналов траектории. Авторы доказывают, что можно оценить, находится ли текущее выполнение агента на правильном пути или стремится к сбою, не заглядывая «внутрь» модели.
Два уровня наблюдаемых признаков
Метод опирается на два типа извлекаемых признаков (features), которые формируются на основе взаимодействия агента с окружением:
- Макро-признаки (Macro features): суммируют поведение агента и обратную связь от среды на протяжении нескольких шагов. Они отражают глобальную динамику взаимодействия.
- Микро-признаки (Micro features): измеряют согласованность намерения, действия и ожидаемого изменения состояния. Эти признаки извлекаются через многократные черные-box запросы (black-box queries), что позволяет детектировать рассинхронизацию на микроуровне.
Ключевой шаг (Key-Step) как маркер ошибки
Традиционный подход часто использует финальный результат (успех/неудача) для обучения. Авторы предлагают более тонкий метод: они маркируют первую критическую ошибку, которая остается не исправленной в наблюдаемом продолжении и приводит к финальному провалу, как границу «ключевого шага» (key-step boundary). Это позволяет сохранять валидные ранние префиксы траекторий, которые в итоге провалились, как «успешные» на начальном этапе, что значительно улучшает качество обучения предиктора.
Результаты на бенчмарках
Метод был протестирован на двух популярных наборах данных для веб-агентов: WebArena-Lite и Online Mind2Web. Эксперименты проводились с использованием пяти открытых и закрытых бэкбон-моделей. Результаты показали, что предикторы, основанные на наблюдаемых траекториях, конкурентоспособны с базовыми линиями, использующими внутренние сигналы.
| Метрика / Аспект | Результат / Характеристика |
|---|---|
| Бенчмарки | WebArena-Lite, Online Mind2Web |
| Количество моделей | 5 (открытые и закрытые источники) |
| Тип сигналов | Только наблюдаемые траектории (без логов модели) |
| Ключевая способность | Раннее вмешательство (early intervention) при фиксированном бюджете ложных срабатываний |
| Обобщающая способность | Переносимость на новые категории сайтов (held-out website categories) |
Значение для индустрии
Разработанный предиктор поддерживает раннее вмешательство при заданном бюджете ложных срабатываний (false-cut budgets). Это означает, что системы безопасности могут прерывать опасные действия агента до того, как они нанесут ущерб, не перегружая операторов ложными тревогами. Кроме того, способность метода переноситься на новые, ранее не виденные категории сайтов делает его универсальным инструментом для мониторинга в динамичной среде веба.
Источник: arXiv cs.AI ↗
