Исследования23 июля 2026 г., 09:17 МСК🤖 Auto

NEXUS: Безопасность LLM-агентов за 0.2 мс с точностью 94.9%

Исследователи представили NEXUS — систему мониторинга безопасности для LLM-агентов, использующих инструменты. Решение обеспечивает F1 0.949 и добавляет менее 0.1% задержки к рабочему циклу агента.

Баннер новости 4183

Проблема безопасности в реальном времени

По мере того как LLM-агенты начинают выполнять высокоуровневые действия (отправка писем, управление кодом, доступ к API), критически важным становится мониторинг безопасности на этапе выполнения (runtime). Традиционные методы часто либо слишком медленны, либо не способны оценить контекст аргументов вызова функции. Команда исследователей во главе с Элиасом Хоссейном представила NEXUS (Neural EXecution Utility and Safety) — структурированный план безопасности, который применяет формальную политику вмешательства к действиям агента.

Как работает NEXUS

Система не просто блокирует запросы, а выбирает одну из четырех стратегий вмешательства:

  • Allow (Разрешить): действие безопасно.
  • Block (Заблокировать): действие представляет угрозу.
  • Request confirmation (Запросить подтверждение): требуется вмешательство человека.
  • Request revision (Запросить пересмотр): агент должен изменить аргументы.

Архитектура NEXUS сочетает детерминированные правила безопасности, инспекцию на уровне аргументов и калиброванный логистический регрессионный скорер риска для градации эскалации. Это позволяет системе принимать взвешенные решения, а не действовать по принципу «белый/черный» список.

Результаты бенчмарков

Эффективность NEXUS была протестирована на синтетическом наборе данных из 128 инстансов, а также на стандартных наборах данных для оценки безопасности агентов. Система демонстрирует значительное превосходство над подходами, использующими только правила (rule-only), особенно в задачах классификации типа вмешательства.

Метрика / Набор данных NEXUS Rule-only (Базовый) Примечание
F1 Score (Синтетический бенчмарк) 0.949 Высокая точность классификации
Точность вмешательства (4 класса) 0.6406 Превосходство на 27.3 п.п. над rule-only
R-Judge (F1 Score) 0.861 0.849 Улучшение показателя
AgentHarm Сопоставимо с rule-only (ограничения threat-model)
IPI (ASR при 99% control allow) 0% Нулевая частота ложных срабатываний
NEXUS-Stress (Rule-blind) 0.881 Сложность маршрутизации тонких вмешательств

Производительность и внедрение

Ключевым преимуществом NEXUS является минимальное влияние на производительность. Медианная задержка системы составляет всего 0.205 мс, что добавляет менее 0.1% накладных расходов к типичным циклам выполнения агентов. Это делает технологию пригодной для использования в высоконагруженных продакшен-средах, где задержка критична.

Открытый доступ

Авторы опубликовали код, бенчмарки и калиброванный скорер риска в открытом доступе, что позволяет сообществу AI-разработчиков интегрировать NEXUS в свои проекты для повышения безопасности автономных агентов.

Источник: arXiv cs.AI ↗