Один вредный e-mail уже сегодня может заставить AI-агента слить рабочий контекст целой команды. Исследователи Google описали десятки реальных атак, и часть срабатывает даже при аккуратной настройке. Проблема в том, что агент теперь не просто читает, а действует.
Самое опасное уже происходит в обычных документах и сайтах

Атаки прячут прямо в том, что выглядит безопасно: письма, отчёты, веб-страницы, изображения. Человек видит нормальный текст, а агент получает скрытую команду и выполняет её. Это не теория, а набор работающих сценариев из реальной практики.
- Invisible instructions (невидимые инструкции) в коде страницы, которые человек не замечает.
- Команды внутри пикселей изображения, которые модель распознаёт как текст или сигнал.
- Сайты, меняющие контент только при обнаружении AI-агента, а пользователю показывающие «чистую» версию.
- Prompt injection (внедрение команд в запрос) через поддельно «официальные» формулировки.
- Фальшивые документы, которые агент принимает за подтверждённые факты.
- Отравленные базы RAG (поиск с подключением базы знаний), где 0,1% мусора меняет поведение.
- Сводки, пересылающие вредные инструкции как «полезные рекомендации» для менеджера или аналитика.
- Фальшивые финансовые отчёты, запускающие автоматические распродажи активов.
- Разделённые вредные фрагменты, которые становятся атакой только после объединения из разных источников.
Что реально изменилось для бизнеса и команд
Раньше AI чаще отвечал текстом, и ошибку можно было поймать глазами. Теперь агент получает доступ к почте, CRM, документам и действиям в сервисах. Ошибка превращается в операцию: отправку данных, изменение записи, запуск процесса.
Если у вас маркетинговый бот, он может скопировать вредный текст в рассылку. Если у вас аналитический агент, он может принять липовый отчёт за факт. Если у вас помощник продаж, он может открыть доступ не тому получателю.
Главное изменение простое: поверхность атаки выросла в разы. Любой вход, от PDF до заметки в базе, стал точкой риска. Даже «умная» автоматизация без злого умысла может масштабировать вред за минуты.
Зачем Google это опубликовала и что за этим стоит
Причина прагматичная: рынок быстро двигается к автономным агентам. Компании подключают AI к финансам, поддержке, закупкам и внутренним базам. Без новой модели безопасности это похоже на стажёра с мастер-ключом от всех комнат.
Публикация задаёт новую норму: проверять не только модель, но и весь контур данных. Нужны тесты на adversarial attacks (атаки с намеренным обманом), а не только на точность ответов. Иначе красивый демо-бот в продакшене становится уязвимостью уровня инфраструктуры.
Отдельный сигнал для руководителей: вопрос уже не «какой AI выбрать». Вопрос теперь «какой ущерб он создаст при ошибке и как быстро мы это остановим». Это управленческая, а не только техническая задача.
Как применить это прямо сейчас, даже без большой команды безопасности
Начните с простого правила: агент не должен иметь «полные права по умолчанию». Каждое действие выше чтения подтверждайте политикой и контекстной проверкой. Дешевле добавить трение сегодня, чем закрывать инцидент завтра.
- Разделите роли: чтение, анализ, действие. Не давайте одному агенту всё сразу.
- Добавьте фильтры на вход: письма, PDF, ссылки, изображения, заметки из базы.
- Включите журналирование действий, чтобы видеть источник команды и цепочку решений.
- Проверяйте данные для RAG (поиск с подключением базы знаний) отдельным пайплайном валидации.
- Ставьте лимиты на автоматические операции: суммы, объёмы, критичность сценариев.
- Проводите красные тесты раз в месяц, имитируя реальные атаки на бизнес-процессы.
- Обучите команду распознавать «авторитетный тон» как возможный социальный обман.
Полезный минимум: сначала песочница, потом ограниченный пилот, и только затем широкий запуск. Для критичных задач держите «человека в контуре» до стабильных метрик безопасности. Источник исследования: публикация на SSRN.
Мы входим в этап, где самый ценный AI не тот, что умнее всех. Победит тот, кто умеет думать и останавливаться в сомнительной ситуации быстрее конкурентов.
_0.png)