Проблема безопасности в реальном времени
По мере того как LLM-агенты начинают выполнять высокоуровневые действия (отправка писем, управление кодом, доступ к API), критически важным становится мониторинг безопасности на этапе выполнения (runtime). Традиционные методы часто либо слишком медленны, либо не способны оценить контекст аргументов вызова функции. Команда исследователей во главе с Элиасом Хоссейном представила NEXUS (Neural EXecution Utility and Safety) — структурированный план безопасности, который применяет формальную политику вмешательства к действиям агента.
Как работает NEXUS
Система не просто блокирует запросы, а выбирает одну из четырех стратегий вмешательства:
- Allow (Разрешить): действие безопасно.
- Block (Заблокировать): действие представляет угрозу.
- Request confirmation (Запросить подтверждение): требуется вмешательство человека.
- Request revision (Запросить пересмотр): агент должен изменить аргументы.
Архитектура NEXUS сочетает детерминированные правила безопасности, инспекцию на уровне аргументов и калиброванный логистический регрессионный скорер риска для градации эскалации. Это позволяет системе принимать взвешенные решения, а не действовать по принципу «белый/черный» список.
Результаты бенчмарков
Эффективность NEXUS была протестирована на синтетическом наборе данных из 128 инстансов, а также на стандартных наборах данных для оценки безопасности агентов. Система демонстрирует значительное превосходство над подходами, использующими только правила (rule-only), особенно в задачах классификации типа вмешательства.
| Метрика / Набор данных | NEXUS | Rule-only (Базовый) | Примечание |
|---|---|---|---|
| F1 Score (Синтетический бенчмарк) | 0.949 | — | Высокая точность классификации |
| Точность вмешательства (4 класса) | 0.6406 | — | Превосходство на 27.3 п.п. над rule-only |
| R-Judge (F1 Score) | 0.861 | 0.849 | Улучшение показателя |
| AgentHarm | — | — | Сопоставимо с rule-only (ограничения threat-model) |
| IPI (ASR при 99% control allow) | 0% | — | Нулевая частота ложных срабатываний |
| NEXUS-Stress (Rule-blind) | 0.881 | — | Сложность маршрутизации тонких вмешательств |
Производительность и внедрение
Ключевым преимуществом NEXUS является минимальное влияние на производительность. Медианная задержка системы составляет всего 0.205 мс, что добавляет менее 0.1% накладных расходов к типичным циклам выполнения агентов. Это делает технологию пригодной для использования в высоконагруженных продакшен-средах, где задержка критична.
Открытый доступ
Авторы опубликовали код, бенчмарки и калиброванный скорер риска в открытом доступе, что позволяет сообществу AI-разработчиков интегрировать NEXUS в свои проекты для повышения безопасности автономных агентов.
Источник: arXiv cs.AI ↗
