Исследования20 июля 2026 г., 10:17 МСК🤖 Auto

SeerGuard: Предиктивная защита мобильных AI-агентов от ошибок

Исследователи представили SeerGuard — фреймворк безопасности для мобильных GUI-агентов, использующий предсказание следующего состояния мира для предотвращения опасных действий до их выполнения.

Баннер новости 3932

Проблема реактивной безопасности

Мобильные графические интерфейсные агенты (GUI agents) демонстрируют выдающиеся результаты в автоматизации сложных задач, но их использование сопряжено с критическими рисками. Ошибка в одном действии может привести к необратимым последствиям: удалению данных, несанкционированным платежам или утечке информации. Существующие механизмы безопасности носят преимущественно реактивный характер, анализируя угрозы уже после того, как действие совершено или находится на грани выполнения. SeerGuard решает эту проблему, внедряя проактивную оценку рисков на уровне инструкций и действий.

Архитектура SAWM и предиктивный анализ

В основе SeerGuard лежит унифицированная модель мира, дополненная безопасностью (Safety-Augmented World Model, SAWM). Эта модель обучается с помощью многозадачного обучения, объединяя два ключевых процесса:

  • Предсказание семантического следующего состояния: модель прогнозирует, как изменится интерфейс приложения после предложенного агентом действия.
  • Оценка рисков безопасности: параллельно анализируется вероятность того, что это изменение приведет к негативным последствиям.

Такой подход позволяет системе «видеть на шаг вперед», отфильтровывая опасные инструкции на уровне семантики и оценивая риски конкретных действий в текущем состоянии GUI.

Результаты тестирования на Qwen3-VL-8B

Эксперименты показали высокую эффективность фреймворка при интеграции с моделью Qwen3-VL-8B-Instruct. SeerGuard демонстрирует значительное улучшение баланса между полезностью (utility) и безопасностью (safety), а также снижение стоимости рисков. Ключевые метрики приведены в таблице ниже:

Метрика Без SeerGuard С SeerGuard Параметр
Safety-Utility Score 0.191 0.596 ω=0.8
Risk-Cost Score 0.347 0.130 α=0.8

Рост показателя Safety-Utility с 0.191 до 0.596 свидетельствует о том, что агент стал значительно эффективнее выполнять задачи, не нарушая правила безопасности. Одновременно снижение Risk-Cost с 0.347 до 0.130 указывает на успешное предотвращение потенциально опасных сценариев.

Значение для индустрии

SeerGuard демонстрирует, что интеграция предиктивных моделей мира в агенты может стать стандартом для обеспечения безопасности автономных систем. Способность системы обобщать знания на различные мобильные GUI-агенты делает этот подход масштабируемым решением для разработчиков, стремящихся внедрять AI в критически важные пользовательские интерфейсы без риска фатальных ошибок.

Источник: arXiv cs.AI ↗