Agentic AI, MCP-серверы и LLM-приложения внедряются в кодовую базу быстрее, чем программы безопасности успевают их отслеживать. Mend.io выпустили руководство "Securing AI agents, MCP servers & LLM apps: A practical framework", закрывающее этот разрыв. Документ предлагает три ключевых шага: увидеть значимое, быстро исправить и защитить AI в продакшене, опираясь на семь конкретных артефактов.
Почему традиционный AppSec ломается
Классическая безопасность строилась на предположении, что приложение делает ровно то, что написано в коде. Agentic AI нарушает это правило: поведение агента эмерджентно (возникает) из модели, системного промпта, извлеченного контекста, ввода пользователя и вызываемых инструментов. Два идентичных деплоя могут вести себя по-разному. Новые векторы атак, такие как инъекции промптов через данные, а не код, или отравленные описания инструментов на MCP-серверах, не появляются в CVE-лентах.
Артефакт 1.1: Карта поверхности атаки в 5 слоев
Для начала необходимо понять, где именно кроются риски. Mend.io выделяют пять слоев уязвимости, каждый со своими специфическими угрозами:
| Слой | Компоненты | Типичные угрозы |
|---|---|---|
| Interaction (Взаимодействие) | Ввод пользователя, документы, сообщения между агентами | Инъекции промптов, отравление контекста, эксфильтрация данных |
| Agent (Агент) | Системные промпты, конфиги, память, настройки автономности | Слишком широкие права инструментов, небезопасные настройки по умолчанию, захват целей |
| Integration (Интеграция) | MCP-серверы, определения инструментов, плагины, API | Отравленные описания инструментов, несекьюрные учетные данные, теневые серверы |
| Model (Модель) | Базовые и дообученные модели, эмбеддинги | Модели с истекшим сроком поддержки (EOL), риски цепочки поставок, небезопасные генерации |
| Код, сгенерированный AI, фреймворки AI, SDK | Уязвимый код, CVE во фреймворках, вредоносные пакеты |
Обнаружение теневых AI и AI-BOM
Агенты редко поступают через официальные закупки. Безопасникам нужно искать три категории: теневые агенты, незарегистрированные MCP-серверы и встроенные AI-фреймворки. Mend.io предлагают пять методов обнаружения: сканирование репозиториев на наличие агентных сигнатур, мониторинг исходящего сетевого трафика к API моделей, аудит сервисных аккаунтов, упрощенная регистрация и автоматизация процессов.
Для учета активов вводится AI-BOM (Bill of Materials для AI). Артефакт 2.1 расширяет стандартный BOM, добавляя девять полей для каждого агента или MCP-сервера: идентификатор, зависимость от модели, уровень автономности, права инструментов, масштаб учетных данных, доступ к данным, эндпоинты MCP, расположение промптов и дату последнего обзора.
Артефакт 2.2: Чек-лист из 12 пунктов
Для устранения базовых ошибок безопасности предлагается 12-пунктовый чек-лист. Ключевые требования:
- Учетные данные должны быть ограничены конкретными ресурсами, а не иметь широкий доступ на уровне сервиса.
- Запрет на использование общих учетных данных между агентами.
- Высокоэффективные инструменты требуют подтверждения человеком (human approval).
- Системные промпты хранятся в системе контроля версий, а не редактируются в продакшене.
- Описания инструментов проверяются на наличие контента, способного вызвать инъекцию, перед внедрением.
- Версии моделей фиксируются (pinning), мониторится их статус EOL, назначается владелец.
Триажинг и защита в runtime
AI расширил не только поверхность атаки, но и поверхность обнаружения проблем. Пайплайн безопасности должен работать по схеме: обогащение → приоритизация → триажинг. Приоритизация основывается на достижимости, контексте эксплуатируемости, бизнес-контексте, агентном усилении и доступности исправления.
Автоматизация закрытия уязвимостей допустима только при наличии доказательств (почему это ложное срабатывание). Риски, связанные с новыми классами угроз или поведением AI, должны рассматриваться исключительно человеком. Для защиты в runtime предлагаются guardrails, которые можно развернуть как Python SDK или как отдельный API-сервер в Docker. Минимальный набор включает входящие guardrails (защита от инъекций и jailbreak) и исходящие (защита от утечки PII, ключей и небезопасного контента).
Источник: MarkTechPost ↗
