Проблема: Атаки в открытых мирах
Многосистемные LLM-агенты (LLM-MAS) все чаще используются в критически важных приложениях. Злоумышленники внедряют вредоносные инструкции через коммуникацию между агентами, распространяя вредоносное поведение. В отличие от статических угроз, эти атаки двойно динамичны: атакующие постоянно совершенствуют стратегии, а нормальное поведение агентов меняется по мере расширения системы. Существующие методы защиты, рассматривающие развертывание как закрытую среду, быстро деградируют при сдвиге распределения данных.
Решение: Архитектура OpenEvoShield
Команда разработала OpenEvoShield — коэволюционную систему непрерывной защиты. Ключевые компоненты системы:
- M1 (Асимметричный контроллер скорости): Разделяет скорости обучения для атакующей и нормальной сторон, реагируя на два сигнала дрейфа.
- M2 (Обновление границы нормы): Поддерживает динамическую поведенческую границу с низкой скоростью обновления.
- M3 (Ансамбль политик с EWC): Быстро адаптируется к новым условиям, используя регуляризацию Elastic Weight Consolidation (EWC) для предотвращения катастрофического забывания.
- M4 (Энергетический детектор): Классифицирует новые атаки как выбросы (out-of-distribution), объединяя доказательства на уровне узлов, подграфов и всего графа.
Результаты тестирования
Эксперименты проводились в течение 100 раундов развертывания на пяти бенчмарках и четырех топологиях MAS. Система демонстрирует превосходство над статическими и непрерывными базовыми моделями, эффективно обнаруживая ранее неизвестные атаки при низком уровне ложных срабатываний.
| Компонент | Функция | Ключевая особенность |
|---|---|---|
| M1 | Контроллер скорости | Асимметричное обучение (быстро для атак, медленно для нормы) |
| M2 | Обновление границы | Динамическое поддержание нормы поведения |
| M3 | Ансамбль политик | EWC-регуляризация, защита от забывания |
| M4 | Детектор | Многоуровневый анализ (узел, подграф, граф) |
Значение для индустрии
OpenEvoShield решает фундаментальную проблему безопасности LLM-MAS в открытых мирах, где угрозы не статичны. Способность системы непрерывно адаптироваться без потери эффективности на старых данных делает её перспективным решением для развертывания автономных агентов в реальных условиях.
Источник: arXiv cs.AI ↗
