Суть атаки PlanFlip
Мультиагентные LLM-системы часто строятся по схеме, где Planner (планировщик) разбивает глобальную цель на подзадачи, а Executor (исполнитель) и Critic (критик) их выполняют и проверяют. Исследователи выявили, что фаза планирования — это критическая точка входа. Атакующий может внедрить вредоносный промпт в контекст Планировщика, замаскировав его под легитимный вывод инструмента. Это вызывает каскадный эффект: все последующие подзадачи получают искаженные инструкции, что приводит к полному сбою системы.
Четыре вектора атаки
Фреймворк PlanFlip включает четыре типа инъекций, которые обходят стандартные фильтры ключевых слов:
- GoalSubstitution (PF-1): Подмена глобальной цели.
- PriorityInversion (PF-2): Инверсия приоритетов задач.
- ContextPollution (PF-3): Загрязнение контекста ложными данными.
- RoleConfusion (PF-4): Путаница в ролях агентов.
Результаты тестирования 9 моделей
Авторы провели 3 479 эпизодов тестирования на передовых моделях. Результаты опровергают миф о том, что «сильные» модели безопаснее. Напротив, способность к рассуждению и сложность планирования делают их более уязвимыми к искажению логики.
| Модель | Тип архитектуры | ASR (Успех атаки) | Stealth (Скрытность) | StepShift (Сдвиг плана) |
|---|---|---|---|---|
| GPT-5 | Frontier | 0.68 | — | — |
| GPT-4o | Гомогенная (с Llama-3.3-70B) | ~0.00 | 1.00 | > 0 |
| DeepSeek-R1 | Reasoning-augmented | — | — | 0.00 |
Проблема гомогенности и слепые зоны
Ключевое открытие: использование моделей с одинаковым бэкбонем (например, связка GPT-4o и Llama-3.3-70B) создает «слепую зону». Атака успешно перестраивает план (StepShift > 0), но Критик на той же архитектуре не фиксирует отклонений, сообщая об alignment. Независимые судьи подтвердили семантическое отклонение на уровне -0.20...-0.32 (r = 0.943), которое встроенный критик проигнорировал.
Защита: гетерогенность и консенсус
Единственной моделью, полностью сопротивляющейся атакам (StepShift = 0.00), стала DeepSeek-R1, использующая усиление рассуждений. Для защиты исследователи предложили два метода:
- GoalAnchorCheck (D1): Проверка якоря цели.
- CrossAgentConsensus (D2): Консенсус между агентами.
Эти методы достигли точности обнаружения до 1.00, превзойдя базовые решения с тем же бэкбонем в 15 из 16 случаев. Вывод однозначен: разнообразие моделей (гетерогенность) — необходимое условие безопасности мультиагентных систем.
Источник: arXiv cs.AI ↗
