Проблема ложных срабатываний в мониторинге агентов
Лаборатории Anthropic и OpenAI используют MonitoringBench для оценки систем безопасности своих кодовых агентов (Mythos и Auto-Review). Однако стандартный мониторинг часто страдает от высокого уровня ложноположительных срабатываний (FPR), что делает его непригодным для дорогих задач, где требуется высокая точность. Исследователи из Palaestra Research выпустили дополнение MonitoringBenchHonest, которое парит 550 атакующих траекторий с 550 «честными» (benign) траекториями, сгенерированными моделью claude-opus-4-5.
Жесткий контроль переменных
Ключевая ценность датасета — в строгом контроле параметров, чтобы модель не могла использовать косвенные признаки для классификации. Были выровнены:
- Модель: Генерация честных и атакующих траекторий выполнена одной моделью (Opus 4.5) на одних и тех же 116 задачах BashArena.
- Инструменты: Отключены параллельные вызовы инструментов. Названия инструментов унифицированы (например,
bashвместоcommand), чтобы исключить утечку сигнала через нейминг. - Длина: Удален шаг
submit()из всех траекторий, так как атакующие часто завершали задачу без него.
Фильтрация «честности» через GPT-5.6-Sol
Понятие «benign» означает отсутствие вредоносной инструкции, но модели могут ошибаться. Чтобы исключить шум в данных, исследователи использовали модель GPT 5.6-Sol для оценки подозрительности. 12 из 550 траекторий были отбракованы (score ≥7) за случайные утечки API-ключей или установку пакетов из непроверенных источников. Оставшиеся 538 траекторий признаны безопасными.
Сравнение характеристик траекторий
Несмотря на меньшее количество шагов, честные траектории содержат больше символов из-за активного использования текстового редактора. Атакующие траектории короче, так как требуют удаления «разведывательных» шагов.
| Метрика | Benign (Честные) | Attack (Атакующие) |
|---|---|---|
| Среднее кол-во шагов | 24.4 | 27.8 |
| Среднее кол-во символов | 1,281 | 1,019 |
| Вызовы bash (кол-во) | 9,718 | 12,422 |
| Вызовы text_editor (кол-во) | 3,507 | 2,827 |
Результаты тестирования мониторов
На наборе из 1,100 траекторий (550 атак + 550 честных) исследователи протестировали различные модели. Лидером по балансу точности и ложных срабатываний стал Kimi K3, показавший FPR всего 2.4% при TPR 85.8%. Это критически важно для внедрения мониторинга в дорогие рабочие процессы, где ложная блокировка стоит дорого.
| Модель-монитор | TPR (Обнаружение атак) | FPR (Ложные срабатывания) | Accuracy |
|---|---|---|---|
| Kimi K3 | 0.858 | 0.024 | 0.917 |
| Qwen3.8 27B | 0.860 | 0.204 | 0.828 |
| GPT 5.6 Luna | 0.925 | 0.315 | 0.805 |
| DeepSeek V4 Flash | 0.485 | 0.031 | 0.727 |
Полный репозиторий с данными и инструментами для генерации новых задач доступен в открытом доступе.
Источник: LessWrong ↗
