Исследования13 сентября 2026 г., 18:17 МСК🤖 Auto

Promptware: Как хакеры захватывают AI-агентов и что с этим делать

Исследование раскрывает механику атак 'promptware' на AI-агентов, демонстрируя, как инъекции промтов превращаются в реальные финансовые и репутационные потери.

Баннер новости 7399

Что такое Promptware и почему это опасно

Термин Promptware описывает уязвимости, возникающие в системах, где ИИ-агенты взаимодействуют с внешними данными через естественный язык. В отличие от традиционных SQL-инъекций, здесь атака происходит на уровне семантики. Злоумышленник не взламывает базу данных напрямую, а манипулирует инструкциями (промтами), заставляя агента выполнить вредоносные действия, которые кажутся легитимными с точки зрения логики модели.

Жизненный цикл атаки: от промта к ущербу

Авторы материала описывают цепочку поражения (kill chain), состоящую из нескольких этапов. Атака начинается с инъекции промта (prompt injection), когда вредоносный текст внедряется в контекст диалога или загружаемый документ. Далее следует этап эксплуатации, когда ИИ-агент, не имея механизмов нулевого доверия (Zero Trust), выполняет скрытые команды. Финальный этап — реальный ущерб: несанкционированные переводы средств, утечка PII-данных или распространение дезинформации.

Ключевые уязвимости AI-агентов

Основная проблема заключается в том, что современные LLM (Large Language Models) спроектированы для выполнения инструкций, а не для их критической проверки. Агенты, обладающие доступом к инструментам (tools) — например, отправке email или выполнению кода, — становятся идеальной мишенью. Если агент не разделяет контекст 'пользовательского ввода' и 'системных инструкций', он может подчиниться зловредному запросу.

Метрики и сценарии угроз

В ходе демонстраций атак были зафиксированы следующие сценарии, требующие немедленного внедрения защитных мер:

Тип атаки Механизм Потенциальный ущерб
Direct Injection Внедрение вредоносного промта в пользовательский запрос Обход фильтров безопасности, генерация запрещенного контента
Indirect Injection Заражение внешних данных (PDF, веб-страницы), которые читает агент Кража данных, выполнение несанкционированных транзакций
Tool Hijacking Манипуляция аргументами вызова API через промт Доступ к внутренним системам компании, изменение конфигураций

Пути защиты: Zero Trust для AI

Для борьбы с Promptware предлагается внедрение принципов Zero Trust в архитектуру AI-агентов. Это включает:

  • Сегментацию контекста: Строгое разделение инструкций системы и пользовательского ввода на уровне архитектуры модели.
  • Валидацию действий: Использование 'стражников' (guardrails) или вторичных моделей для проверки намерений агента перед выполнением критических операций.
  • Минимальные привилегии: Ограничение доступа агентов только к тем данным и инструментам, которые необходимы для конкретной задачи.

Игнорирование этих рисков может привести к тому, что AI-агенты станут новым вектором атак для корпоративных сетей, требуя пересмотра подходов к кибербезопасности в эпоху генеративного ИИ.

Источник: Towards AI pub ↗