Исследования28 сентября 2026 г., 12:17 МСК🤖 Auto

Атака каскадом навыков: как безопасные модули AI-агентов создают угрозы

Исследователи из NeurIPS 2026 представили метод SkillCascade, демонстрирующий, как комбинация безобидных на первый взгляд навыков (skills) позволяет обходить защиту и вызывать вредоносные действия в системах на базе LLM.

Баннер новости 8410

Суть уязвимости: «Раздельно — безопасно, вместе — опасно»

В экосистемах AI-агентов, таких как OpenClaw, Claude Code и Codex, функциональность часто расширяется за счет загрузки внешних модулей — навыков (skills). Каждый навык представляет собой набор инструкций, скриптов и ресурсов. Традиционные системы безопасности проверяют каждый навык изолированно. Однако новая работа, принятая в NeurIPS 2026, вскрывает критический пробел: атаки, основанные на взаимодействии нескольких навыков.

Исследователи (Zihao Zhu, Siwei Lyu, Adel Bibi, Baoyuan Wu) ввели понятие skill cascading attacks (каскадные атаки навыков). Злоумышленник распределяет вредоносную цель по нескольким модулям. Каждый модуль в отдельности выглядит безобидным и проходит сканирование, но их совместное выполнение приводит к серьезным нарушениям безопасности.

Механика атаки на примере медицины

Авторы приводят наглядный сценарий в пайплайне проверки рецептов. Атака состоит из трех этапов, где каждый шаг маскируется под легитимную функцию:

  • Навык 1: Ослабляет сигналы о недавно отмененных лекарствах в извлеченной истории пациента.
  • Навык 2: Снижает оценку серьезности взаимодействия любых препаратов, связанных с этими лекарствами.
  • Навык 3: Подавляет итоговое предупреждение низкого приоритета в финальном отчете.

В результате серьезное предупреждение о лекарственном взаимодействии тихо исчезает до того, как его увидит врач. Ни один из модулей по отдельности не вызывает тревоги у систем мониторинга.

Инструменты исследования: SkillCascade и Benchmark

Для систематического изучения этой проблемы команда разработала фреймворк автоматизированного red-teaming под названием SkillCascade. Они также опубликовали SkillCascade-Bench — набор данных, содержащий 213 валидированных каскадных тестовых случаев, охватывающих различные домены и архитектуры агентов.

Результаты тестирования

Эксперименты показали, что каскадные взаимодействия надежно провоцируют вредоносное поведение у современных LLM-бэкендов. Ниже приведена сводка эффективности атаки против различных платформ:

Платформа / Модель Тип уязвимости Результат атаки
OpenClaw Каскадное взаимодействие навыков Успешный обход защитных фильтров
Claude Code Каскадное взаимодействие навыков Генерация вредоносного кода/инструкций
Codex Каскадное взаимодействие навыков Игнорирование критических предупреждений
Различные LLM-бэкенды Системная уязвимость Неэффективность per-skill сканеров

Выводы для индустрии

Исследование подчеркивает разрыв между целостностью отдельных компонентов и безопасностью системы в целом. Существующие средства защиты, анализирующие навыки изолированно, бессильны против этого типа угроз. Авторы призывают к разработке новых методов защиты, которые способны рассуждать о взаимодействиях между навыками (cross-skill interactions), а не только о содержимом каждого модуля в отдельности.

Источник: arXiv cs.AI ↗