Исследования21 июля 2026 г., 08:16 МСК🤖 Auto

PlanFlip: как инъекция в планировщик ломает мультиагентные LLM

Исследование PlanFlip показывает, что мультиагентные системы уязвимы на этапе планирования: одна инъекция в Planner искажает все подзадачи. GPT-5 оказался самым уязвимым, а гомогенные цепочки не обеспечивают безопасности.

Баннер новости 4009

Суть атаки PlanFlip

Мультиагентные LLM-системы часто строятся по схеме, где Planner (планировщик) разбивает глобальную цель на подзадачи, а Executor (исполнитель) и Critic (критик) их выполняют и проверяют. Исследователи выявили, что фаза планирования — это критическая точка входа. Атакующий может внедрить вредоносный промпт в контекст Планировщика, замаскировав его под легитимный вывод инструмента. Это вызывает каскадный эффект: все последующие подзадачи получают искаженные инструкции, что приводит к полному сбою системы.

Четыре вектора атаки

Фреймворк PlanFlip включает четыре типа инъекций, которые обходят стандартные фильтры ключевых слов:

  • GoalSubstitution (PF-1): Подмена глобальной цели.
  • PriorityInversion (PF-2): Инверсия приоритетов задач.
  • ContextPollution (PF-3): Загрязнение контекста ложными данными.
  • RoleConfusion (PF-4): Путаница в ролях агентов.

Результаты тестирования 9 моделей

Авторы провели 3 479 эпизодов тестирования на передовых моделях. Результаты опровергают миф о том, что «сильные» модели безопаснее. Напротив, способность к рассуждению и сложность планирования делают их более уязвимыми к искажению логики.

Модель Тип архитектуры ASR (Успех атаки) Stealth (Скрытность) StepShift (Сдвиг плана)
GPT-5 Frontier 0.68
GPT-4o Гомогенная (с Llama-3.3-70B) ~0.00 1.00 > 0
DeepSeek-R1 Reasoning-augmented 0.00

Проблема гомогенности и слепые зоны

Ключевое открытие: использование моделей с одинаковым бэкбонем (например, связка GPT-4o и Llama-3.3-70B) создает «слепую зону». Атака успешно перестраивает план (StepShift > 0), но Критик на той же архитектуре не фиксирует отклонений, сообщая об alignment. Независимые судьи подтвердили семантическое отклонение на уровне -0.20...-0.32 (r = 0.943), которое встроенный критик проигнорировал.

Защита: гетерогенность и консенсус

Единственной моделью, полностью сопротивляющейся атакам (StepShift = 0.00), стала DeepSeek-R1, использующая усиление рассуждений. Для защиты исследователи предложили два метода:

  1. GoalAnchorCheck (D1): Проверка якоря цели.
  2. CrossAgentConsensus (D2): Консенсус между агентами.

Эти методы достигли точности обнаружения до 1.00, превзойдя базовые решения с тем же бэкбонем в 15 из 16 случаев. Вывод однозначен: разнообразие моделей (гетерогенность) — необходимое условие безопасности мультиагентных систем.

Источник: arXiv cs.AI ↗