Исследования17 июля 2026 г., 04:16 МСК🤖 Auto

Safety Sentry: 3-путевая маршрутизация действий LLM-агентов

Исследователи представили Safety Sentry — легковесную модель-страж, которая заменяет бинарную проверку безопасности на контекстно-зависимую маршрутизацию EXECUTE-ASK-REFUSE, повышая точность и снижая ложные срабатывания.

Баннер новости 3775

Проблема бинарной классификации

Стандартные guard-модели для LLM-агентов часто используют бинарную классификацию: действие либо безопасно, либо нет. Такой подход имеет два критических недостатка. Во-первых, он смешивает два разных решения: является ли действие вредным само по себе и уместно ли оно в текущем контексте пользователя. Во-вторых, он работает на уровне категорий действий, а не конкретных инстансов, что приводит к рутинным прерываниям. Это эрозирует автономию пользователя и приучает его игнорировать даже самые важные предупреждения (alert fatigue).

Решение: EXECUTE-ASK-REFUSE

Команда авторов (Tianyu Chen, Chujia Hu, Wenjie Wang) переосмыслила проблему как задачу маршрутизации на уровне каждого отдельного действия с тремя возможными исходами:

  • EXECUTE — действие безопасно и уместно, выполнить немедленно.
  • ASK — требуется уточнение или подтверждение у человека.
  • REFUSE — действие опасно или недопустимо, заблокировать.

Модель Safety Sentry реализует эту логику через один вызов декодирования (single decoding call). Это делает её вычислительно легкой и быстрой. Ключевая особенность — использование единого порога на этапе декодирования, который позволяет настраивать уровень риска (risk tolerance) для разных развертываний без необходимости переобучения модели.

Результаты и сравнение

Safety Sentry демонстрирует превосходство над широким набором базовых моделей (open-weight и закрытых frontier-моделей) по общей точности и полноте обнаружения угроз (safety-related recall). Важно, что модель успешно контролирует оба типа направленных ошибок одновременно, что критично для практического применения в реальных средах.

Характеристика Стандартный Guard (Бинарный) Safety Sentry (3-путевой)
Гранулярность Категория действия Конкретный инстанс действия
Выходные данные Safe / Unsafe EXECUTE / ASK / REFUSE
Настройка риска Требует переобучения Изменение порога декодирования
Влияние на UX Рутинные прерывания, игнорирование алертов Контекстно-зависимые запросы, сохранение автономии

Почему это важно

По мере того как LLM-агенты все активнее взаимодействуют с реальным миром через вызовы инструментов (tool calls), цена ошибки растет. Одно неверное действие может привести к необратимому ущербу. Safety Sentry предлагает более тонкий и эффективный механизм контроля, который не просто блокирует, а анализирует контекст, минимизируя ложные срабатывания и сохраняя доверие пользователя к системе безопасности.

Источник: arXiv cs.AI ↗