Проблема: стандартные тесты не работают для агентов
По мере перехода Agentic AI в продакшн, модели перестают быть просто чат-ботами. Они читают недоверенные данные, вызывают инструменты с реальными правами и действуют автономно. Стандартные односторонние оценки (single-turn) не способны зафиксировать многошаговые уязвимости, возникающие при взаимодействии агентов с внешней средой. Исследователи из группы Divyanshu Kumar разработали методологию SAGE-RT (Systematic Automated Governance and Ethics Red Teaming), которая позволяет проводить red teaming «черного ящика» — без привилегированного доступа к внутреннему коду модели.
Методология: 7 доменов и 120 сценариев
Фреймворк опирается на семидоменную таксономию, которая сопоставляет наблюдаемое поведение агента с категориями рисков. Для каждого домена система автоматически генерирует 120 адверсариальных сценариев. Оценка проводится с помощью LLM-судей, результаты которых затем верифицируются человеком. Подход требует только базового описания системы, что делает его масштабируемым для различных архитектур.
Результаты: пугающая статистика уязвимостей
Эмпирическая валидация проводилась на двух популярных фреймворках агентов — CrewAI и AutoGen — с использованием четырех базовых моделей. Результаты выявили системные проблемы в безопасности:
| Метрика риска | Значение | Контекст |
|---|---|---|
| Поведенческие уязвимости | 85% | Способность агентов выполнять нежелательные действия |
| Риски приватности | 65% | В многоагентных конфигурациях (multi-agent) |
| Риски governance | 56.25% | Средний показатель по всем доменам |
Почему это важно
Высокий процент уязвимостей (особенно 85% по поведенческим рискам) показывает, что текущие архитектуры агентов не готовы к автономной работе в неконтролируемой среде. Утечка приватности в 65% случаев в мультиагентных системах указывает на то, что данные могут неконтролируемо передаваться между агентами. Представленный фреймворк SAGE-RT предлагает масштабируемый путь к более безопасному развертыванию, позволяя обнаруживать архитектурные дыры до того, как агенты попадут в продакшн.
Источник: arXiv cs.AI ↗
