Проблема фрагментарной безопасности
AI-агенты на базе больших языковых моделей (LLM) эволюционируют от изолированных помощников к гетерогенным системам, где планировщики, контроллеры и бэкенды исполнения работают в общей среде. В таких условиях безопасность становится проблемой управления действиями на уровне системы: необходимо решать, следует ли коммитить конкретные действия агента до их модификации общего состояния. Существующие средства защиты часто фрагментированы, скрывают риски, возникающие в многошаговых потоках действий, и ограничивают возможности аудита и эволюции политик.
Архитектура OpenAgentFlow
Команда разработчиков во главе с Дуншэном Чэнем предложила архитектуру control-plane/action-plane, которая обеспечивает безопасность на границе коммита действий. Система нормализует ожидающие GUI-действия, вызовы API, инструментальные вызовы и инвокации LLM в единый поток AgentEvent. Каждое событие маршрутизируется через общую точку принудительного применения политик (Policy Enforcement Point) перед выполнением. Контрольная плоскость поддерживает происхождение данных, состояние сессии, записи аудита и обновляемые политики, позволяя внедрять новые правила без изменения самих агентов, промптов или моделей.
Результаты бенчмарков на Android
Реализация OpenAgentFlow была протестирована на платформе Android. Исследователи провели серию тестов, оценивающих как точность распознавания действий, так и эффективность блокировки атак. Ниже представлены ключевые метрики производительности системы:
| Метрика / Тест | Результат | Детали |
|---|---|---|
| Бенчмарк действий | 94.0% точность | Набор из 300 случаев (action-event benchmark) |
| Блокировка атак | 95.3% | Доля успешно заблокированных вредоносных действий |
| Динамические политики | 27 из 30 | Совпадение с ожидаемым поведением после установки новых правил |
| Эмулятор Android | 90.8% точность | 98 проанализированных случаев из 100 (GUI, API, LLM-planned) |
| Trace-adjusted pass rate | 92.9% | Скорректированный показатель прохождения тестов |
Значение для индустрии
Результаты демонстрируют, что OpenAgentFlow предоставляет практическую общую границу принуждения для разнородных флотов AI-агентов. Ключевое преимущество подхода — возможность обновления политик безопасности «на лету» без переписывания кода агентов или их базовых моделей. Это критически важно для корпоративных сред, где требования к безопасности и compliance часто меняются, а использование множества различных AI-инструментов создает сложные векторы атак.
Источник: arXiv cs.AI ↗
