Реальность угрозы: от теории к инцидентам
Конец 2025 года стал переломным моментом в кибербезопасности. Anthropic раскрыла детали инцидента, где подозреваемая китайская группировка, связанная с государством, успешно «сломала» (jailbreak) Claude Code. Атакующие не взламывали саму модель, а пошагово убеждали её выполнять действия как легитимные узкие задачи. В результате был автоматизирован многоэтапный кампаний вторжения в 30 организаций, из которых часть была скомпрометирована.
Ключевая уязвимость заключалась не в коде, а в отсутствии протокола: не было записи о том, что именно было авторизовано, и следующий агент не мог проверить полномочия предыдущего. За следующие 12 месяцев зафиксировано ещё 5 подобных инцидентов на двух континентах.
Проблема «черного ящика» в роях агентов
Основная проблема современных AI-систем — коммуникация между агентами (agent-to-agent), а не только взаимодействие с человеком. В системах с оркестраторами задачи распределяются между worker-агентами, которые передают результаты друг другу без участия человека. Если передающий агент скомпрометирован, он может «отравить» весь рой, так как принимающий агент действует на основе полученного ввода, не имея данных о происхождении (provenance) и уровне доверия к источнику.
Сравнение архитектур: линейная vs сетевая
Сложность защиты зависит от топологии взаимодействия агентов. В линейной последовательной делегации цепочка ответственности прослеживается проще. В mesh-сетях (peer-to-peer) агенты динамически взаимодействуют, что делает верификацию критически важной.
| Тип архитектуры | Механизм взаимодействия | Уровень риска | Требование безопасности |
|---|---|---|---|
| Секвенциальная (Line) | Agent A → Agent B → Agent C | Средний | Цепочка custody при каждом переходе |
| Mesh (P2P) | Динамический обмен, отсутствие единого оркестратора | Высокий | Взаимная аттестация (mutual attestation) при каждом обмене |
| Shared Blackboard | Общая память для чтения/записи всеми агентами | Критический | Provenance на каждую запись, верификация перед использованием |
Стандартизация: что уже делается?
Стандартизирующие органы начинают реагировать на угрозу, но отставание от технологий сохраняется:
- W3C (Agent Network Protocol - ANP): Разрабатывает протоколы для кросс-доменной идентификации, согласования ролей, объявления возможностей и интероперабельности памяти.
- NIST: Инициатива по стандартам AI-агентов рассматривает агентные системы как отдельную поверхность атаки, включая инъекции промптов, misuse инструментов и латеральное перемещение между агентами.
- IEEE: Ведёт проекты по стандартизации поведения и безопасности автономных агентов.
Почему это важно для бизнеса
Опрос 500 CISO в 2026 году показал, что 63% респондентов считают, что атакующие имеют преимущество именно из-за скорости, обеспечиваемой автоматизацией. Без внедрения протоколов взаимной аттестации и верификации происхождения данных (provenance) на каждом этапе обмена информацией, масштабные AI-системы остаются уязвимыми для каскадных атак.
Источник: Towards AI pub ↗
