Инструменты4 августа 2026 г., 01:17 МСК🤖 Auto

Mend.io: 7 артефактов для защиты AI-агентов и MCP-серверов

Традиционный AppSec не справляется с рисками Agentic AI. Mend.io представили практическое руководство с 7 артефактами для обнаружения теневых агентов, защиты от инъекций и автоматизации триажинга уязвимостей.

Баннер новости 4994

Agentic AI, MCP-серверы и LLM-приложения внедряются в кодовую базу быстрее, чем программы безопасности успевают их отслеживать. Mend.io выпустили руководство "Securing AI agents, MCP servers & LLM apps: A practical framework", закрывающее этот разрыв. Документ предлагает три ключевых шага: увидеть значимое, быстро исправить и защитить AI в продакшене, опираясь на семь конкретных артефактов.

Почему традиционный AppSec ломается

Классическая безопасность строилась на предположении, что приложение делает ровно то, что написано в коде. Agentic AI нарушает это правило: поведение агента эмерджентно (возникает) из модели, системного промпта, извлеченного контекста, ввода пользователя и вызываемых инструментов. Два идентичных деплоя могут вести себя по-разному. Новые векторы атак, такие как инъекции промптов через данные, а не код, или отравленные описания инструментов на MCP-серверах, не появляются в CVE-лентах.

Артефакт 1.1: Карта поверхности атаки в 5 слоев

Для начала необходимо понять, где именно кроются риски. Mend.io выделяют пять слоев уязвимости, каждый со своими специфическими угрозами:

d>Code (Код)
Слой Компоненты Типичные угрозы
Interaction (Взаимодействие) Ввод пользователя, документы, сообщения между агентами Инъекции промптов, отравление контекста, эксфильтрация данных
Agent (Агент) Системные промпты, конфиги, память, настройки автономности Слишком широкие права инструментов, небезопасные настройки по умолчанию, захват целей
Integration (Интеграция) MCP-серверы, определения инструментов, плагины, API Отравленные описания инструментов, несекьюрные учетные данные, теневые серверы
Model (Модель) Базовые и дообученные модели, эмбеддинги Модели с истекшим сроком поддержки (EOL), риски цепочки поставок, небезопасные генерации
Код, сгенерированный AI, фреймворки AI, SDK Уязвимый код, CVE во фреймворках, вредоносные пакеты

Обнаружение теневых AI и AI-BOM

Агенты редко поступают через официальные закупки. Безопасникам нужно искать три категории: теневые агенты, незарегистрированные MCP-серверы и встроенные AI-фреймворки. Mend.io предлагают пять методов обнаружения: сканирование репозиториев на наличие агентных сигнатур, мониторинг исходящего сетевого трафика к API моделей, аудит сервисных аккаунтов, упрощенная регистрация и автоматизация процессов.

Для учета активов вводится AI-BOM (Bill of Materials для AI). Артефакт 2.1 расширяет стандартный BOM, добавляя девять полей для каждого агента или MCP-сервера: идентификатор, зависимость от модели, уровень автономности, права инструментов, масштаб учетных данных, доступ к данным, эндпоинты MCP, расположение промптов и дату последнего обзора.

Артефакт 2.2: Чек-лист из 12 пунктов

Для устранения базовых ошибок безопасности предлагается 12-пунктовый чек-лист. Ключевые требования:

  • Учетные данные должны быть ограничены конкретными ресурсами, а не иметь широкий доступ на уровне сервиса.
  • Запрет на использование общих учетных данных между агентами.
  • Высокоэффективные инструменты требуют подтверждения человеком (human approval).
  • Системные промпты хранятся в системе контроля версий, а не редактируются в продакшене.
  • Описания инструментов проверяются на наличие контента, способного вызвать инъекцию, перед внедрением.
  • Версии моделей фиксируются (pinning), мониторится их статус EOL, назначается владелец.

Триажинг и защита в runtime

AI расширил не только поверхность атаки, но и поверхность обнаружения проблем. Пайплайн безопасности должен работать по схеме: обогащение → приоритизация → триажинг. Приоритизация основывается на достижимости, контексте эксплуатируемости, бизнес-контексте, агентном усилении и доступности исправления.

Автоматизация закрытия уязвимостей допустима только при наличии доказательств (почему это ложное срабатывание). Риски, связанные с новыми классами угроз или поведением AI, должны рассматриваться исключительно человеком. Для защиты в runtime предлагаются guardrails, которые можно развернуть как Python SDK или как отдельный API-сервер в Docker. Минимальный набор включает входящие guardrails (защита от инъекций и jailbreak) и исходящие (защита от утечки PII, ключей и небезопасного контента).

Источник: MarkTechPost ↗