Суть открытия: архитектура как переменная безопасности
Команда исследователей (Hagag, Anderson, Schroeder de Witt, Scheffler) провела масштабный анализ многоагентных систем (MAS), адаптировав три известных бенчмарка для однопользовательских моделей в многоагентные сценарии. Главный вывод: безопасность системы не коррелирует с её производительностью. Более того, не существует универсальной «безопасной» архитектуры. Топология, которая минимизирует риски в одной среде, может максимизировать их в другой. Это опровергает интуитивное предположение, что усиление контроля в одном узле всегда улучшает общую защиту.
Три ключевых рычага (knobs) настройки
Исследователи варьировали три фундаментальных параметра архитектуры, удерживая модели и задачи неизменными:
- Конфигурация ролей: Распределение полномочий. Тестировались варианты от общего агента до специализированных исполнителей (2, 3, 4 специалиста). Ключевой вопрос: фрагментация задачи помогает ли агентам «не заметить» вредоносный запрос, или, наоборот, создает лишние контрольные точки?
- Топология коммуникации: Как агенты обмениваются данными. Рассматривались три схемы: Star (звезда с центральным оркестратором), Chain (цепочка/пайплайн) и Mesh (полносвязная сеть без центра). В цепочке информация фильтруется, что может лишить агента контекста для распознавания угрозы. В mesh-сети контроль распределен, но риски распространения ошибки выше.
- Видимость памяти: От приватных черновиков до полного общего доступа к истории выполнения всех агентов. Общая память повышает прозрачность, но позволяет вредоносному поведению распространяться быстрее.
Методология и бенчмарки
Эксперименты проводились на шести моделях: GPT-4o, GPT-5.4, GPT-5-mini, Claude Sonnet 4, Qwen3-VL и Llama-70B. Были использованы три адаптированных сценария:
| Бенчмарк | Сфера применения | Особенность разделения |
|---|---|---|
| BrowserART | Управление браузером | Четкое разделение инструментов (goto, click, fill, scroll) на 4 специалистов |
| OS-Harm | Использование десктопа | Пиксельное управление, разделенное на под-инструменты (клик, ввод, скролл) |
| RedCode-Gen | Генерация кода | Роли: Design / Code / Review / Test с инструментами python, editor, bash, think |
Метрики и результаты
Результаты классифицировались по четырем исходам траектории: Planning Refusal (отказ на этапе планирования), Execution Refusal (отказ исполнителя), Harmful Action (вредное действие без завершения цели) и Harmful Task (полное выполнение вредоносной цели). Ключевой метрикой стала доля успешных вредоносных задач (HT).
Исследование показало, что добавление агентов увеличивает поверхность атаки. Фрагментация задачи позволяет вредоносным запросам просачиваться через агентов, которые бы отказали в выполнении, если бы видели всю задачу целиком. Однако эффект непредсказуем: в некоторых конфигурациях декомпозиция повышала вероятность обнаружения угрозы, в других — снижала.
Почему это важно для индустрии
Результаты ставят под сомнение текущие подходы к безопасности ИИ, сфокусированные на защите отдельных моделей (prompt injection, jailbreaks). Авторы подчеркивают, что защита компонентов не гарантирует защиту системы. Для решения проблемы требуется новый класс инструментов. Команда анонсировала выпуск фреймворка Orbit v0 — первой динамической платформы для оценки безопасности многоагентных систем, с открытым кодом и сценариями на GitHub. Презентация работы состоится на ICML 2026 в Сеуле.
Источник: LessWrong ↗
