Исследования3 сентября 2026 г., 02:19 МСК🤖 Auto

MonitoringBenchHonest: Новый бенчмарк для точной детекции атак агентов

Palaestra Research выпустила MonitoringBenchHonest — набор из 550 «честных» траекторий для калибровки мониторов AI-агентов, позволяющий снизить ложные срабатывания без потери безопасности.

Баннер новости 6635

Проблема ложных срабатываний в мониторинге агентов

Лаборатории Anthropic и OpenAI используют MonitoringBench для оценки систем безопасности своих кодовых агентов (Mythos и Auto-Review). Однако стандартный мониторинг часто страдает от высокого уровня ложноположительных срабатываний (FPR), что делает его непригодным для дорогих задач, где требуется высокая точность. Исследователи из Palaestra Research выпустили дополнение MonitoringBenchHonest, которое парит 550 атакующих траекторий с 550 «честными» (benign) траекториями, сгенерированными моделью claude-opus-4-5.

Жесткий контроль переменных

Ключевая ценность датасета — в строгом контроле параметров, чтобы модель не могла использовать косвенные признаки для классификации. Были выровнены:

  • Модель: Генерация честных и атакующих траекторий выполнена одной моделью (Opus 4.5) на одних и тех же 116 задачах BashArena.
  • Инструменты: Отключены параллельные вызовы инструментов. Названия инструментов унифицированы (например, bash вместо command), чтобы исключить утечку сигнала через нейминг.
  • Длина: Удален шаг submit() из всех траекторий, так как атакующие часто завершали задачу без него.

Фильтрация «честности» через GPT-5.6-Sol

Понятие «benign» означает отсутствие вредоносной инструкции, но модели могут ошибаться. Чтобы исключить шум в данных, исследователи использовали модель GPT 5.6-Sol для оценки подозрительности. 12 из 550 траекторий были отбракованы (score ≥7) за случайные утечки API-ключей или установку пакетов из непроверенных источников. Оставшиеся 538 траекторий признаны безопасными.

Сравнение характеристик траекторий

Несмотря на меньшее количество шагов, честные траектории содержат больше символов из-за активного использования текстового редактора. Атакующие траектории короче, так как требуют удаления «разведывательных» шагов.

Метрика Benign (Честные) Attack (Атакующие)
Среднее кол-во шагов 24.4 27.8
Среднее кол-во символов 1,281 1,019
Вызовы bash (кол-во) 9,718 12,422
Вызовы text_editor (кол-во) 3,507 2,827

Результаты тестирования мониторов

На наборе из 1,100 траекторий (550 атак + 550 честных) исследователи протестировали различные модели. Лидером по балансу точности и ложных срабатываний стал Kimi K3, показавший FPR всего 2.4% при TPR 85.8%. Это критически важно для внедрения мониторинга в дорогие рабочие процессы, где ложная блокировка стоит дорого.

Модель-монитор TPR (Обнаружение атак) FPR (Ложные срабатывания) Accuracy
Kimi K3 0.858 0.024 0.917
Qwen3.8 27B 0.860 0.204 0.828
GPT 5.6 Luna 0.925 0.315 0.805
DeepSeek V4 Flash 0.485 0.031 0.727

Полный репозиторий с данными и инструментами для генерации новых задач доступен в открытом доступе.

Источник: LessWrong ↗