Исследования11 сентября 2026 г., 15:21 МСК🤖 Auto

Автоматический Red Teaming агентов: 85% уязвимостей найдено без доступа к коду

Исследователи представили фреймворк SAGE-RT для черного ящика, выявивший критические риски в CrewAI и AutoGen: 65% утечек приватности и 56% нарушений governance.

Баннер новости 7273

Проблема: стандартные тесты не работают для агентов

По мере перехода Agentic AI в продакшн, модели перестают быть просто чат-ботами. Они читают недоверенные данные, вызывают инструменты с реальными правами и действуют автономно. Стандартные односторонние оценки (single-turn) не способны зафиксировать многошаговые уязвимости, возникающие при взаимодействии агентов с внешней средой. Исследователи из группы Divyanshu Kumar разработали методологию SAGE-RT (Systematic Automated Governance and Ethics Red Teaming), которая позволяет проводить red teaming «черного ящика» — без привилегированного доступа к внутреннему коду модели.

Методология: 7 доменов и 120 сценариев

Фреймворк опирается на семидоменную таксономию, которая сопоставляет наблюдаемое поведение агента с категориями рисков. Для каждого домена система автоматически генерирует 120 адверсариальных сценариев. Оценка проводится с помощью LLM-судей, результаты которых затем верифицируются человеком. Подход требует только базового описания системы, что делает его масштабируемым для различных архитектур.

Результаты: пугающая статистика уязвимостей

Эмпирическая валидация проводилась на двух популярных фреймворках агентов — CrewAI и AutoGen — с использованием четырех базовых моделей. Результаты выявили системные проблемы в безопасности:

Метрика риска Значение Контекст
Поведенческие уязвимости 85% Способность агентов выполнять нежелательные действия
Риски приватности 65% В многоагентных конфигурациях (multi-agent)
Риски governance 56.25% Средний показатель по всем доменам

Почему это важно

Высокий процент уязвимостей (особенно 85% по поведенческим рискам) показывает, что текущие архитектуры агентов не готовы к автономной работе в неконтролируемой среде. Утечка приватности в 65% случаев в мультиагентных системах указывает на то, что данные могут неконтролируемо передаваться между агентами. Представленный фреймворк SAGE-RT предлагает масштабируемый путь к более безопасному развертыванию, позволяя обнаруживать архитектурные дыры до того, как агенты попадут в продакшн.

Источник: arXiv cs.AI ↗