Проблема бинарной классификации
Стандартные guard-модели для LLM-агентов часто используют бинарную классификацию: действие либо безопасно, либо нет. Такой подход имеет два критических недостатка. Во-первых, он смешивает два разных решения: является ли действие вредным само по себе и уместно ли оно в текущем контексте пользователя. Во-вторых, он работает на уровне категорий действий, а не конкретных инстансов, что приводит к рутинным прерываниям. Это эрозирует автономию пользователя и приучает его игнорировать даже самые важные предупреждения (alert fatigue).
Решение: EXECUTE-ASK-REFUSE
Команда авторов (Tianyu Chen, Chujia Hu, Wenjie Wang) переосмыслила проблему как задачу маршрутизации на уровне каждого отдельного действия с тремя возможными исходами:
- EXECUTE — действие безопасно и уместно, выполнить немедленно.
- ASK — требуется уточнение или подтверждение у человека.
- REFUSE — действие опасно или недопустимо, заблокировать.
Модель Safety Sentry реализует эту логику через один вызов декодирования (single decoding call). Это делает её вычислительно легкой и быстрой. Ключевая особенность — использование единого порога на этапе декодирования, который позволяет настраивать уровень риска (risk tolerance) для разных развертываний без необходимости переобучения модели.
Результаты и сравнение
Safety Sentry демонстрирует превосходство над широким набором базовых моделей (open-weight и закрытых frontier-моделей) по общей точности и полноте обнаружения угроз (safety-related recall). Важно, что модель успешно контролирует оба типа направленных ошибок одновременно, что критично для практического применения в реальных средах.
| Характеристика | Стандартный Guard (Бинарный) | Safety Sentry (3-путевой) |
|---|---|---|
| Гранулярность | Категория действия | Конкретный инстанс действия |
| Выходные данные | Safe / Unsafe | EXECUTE / ASK / REFUSE |
| Настройка риска | Требует переобучения | Изменение порога декодирования |
| Влияние на UX | Рутинные прерывания, игнорирование алертов | Контекстно-зависимые запросы, сохранение автономии |
Почему это важно
По мере того как LLM-агенты все активнее взаимодействуют с реальным миром через вызовы инструментов (tool calls), цена ошибки растет. Одно неверное действие может привести к необратимому ущербу. Safety Sentry предлагает более тонкий и эффективный механизм контроля, который не просто блокирует, а анализирует контекст, минимизируя ложные срабатывания и сохраняя доверие пользователя к системе безопасности.
Источник: arXiv cs.AI ↗
