Исследования3 августа 2026 г., 11:17 МСК🤖 Auto

Бенчмарки безопасности AI — это обман? Аудит R-Judge и AgentHarm

Исследование arXiv:2607.28685 доказывает, что популярные метрики безопасности AI-агентов часто измеряют не защиту, а общую способность модели. Авторы выявили критические статистические артефакты в R-Judge и AgentHarm.

Баннер новости 4939

Проблема: безопасность или просто интеллект?

Команда исследователей во главе с Ютао Ваном (Youting Wang) провела валидационный аудит четырех ключевых бенчмарков безопасности AI-агентов: R-Judge, InjecAgent, AgentHarm и AgentDojo. Они протестировали их на панели из 22 моделей, используя официальные реализации и скореры. Параллельно была измерена общая способность моделей (capability) через метрики MMLU и GPQA. Цель — понять, действительно ли эти инструменты измеряют «безопасность» или же они лишь отражают общую вычислительную мощь и обученность модели.

Критический провал метрики F1 в R-Judge

Самый тревожный результат касается бенчмарка R-Judge. Авторы показали, что при оценке бинарных решений (trace-judgment) с использованием метрики F1, стратегия «всегда предсказывать положительный класс» (always positive) дает результат F1 = 2π/(1+π). Для R-Judge это значение составляет 0.690. Это выше, чем у пяти из 21 реальной модели, которые действительно способны различать безопасные и опасные ответы. Проще говоря, простая заглушка работает лучше, чем половина тестируемых AI-систем, что ставит под сомнение валидность самого бенчмарка.

Нестабильность корреляций и артефакты выборки

Исследование выявило, что результаты сильно зависят от размера панели моделей (small-panel artifact). Корреляция специфичности R-Judge с безопасностью AgentHarm меняется от -0.64 при малой выборке (n=7) до +0.02 при полной (n=18). Более того, четверть случайных подвыборок из 7 моделей достигают корреляции |ρ| ≥ 0.5 около нулевого значения. Это означает, что выводы о безопасности модели могут кардинально меняться в зависимости от того, какие именно модели попали в тест.

Capability vs. Misalignment: что на самом деле измеряют тесты?

Общая способность модели (capability) положительно коррелирует с успешностью выполнения задач (ρ=+0.60), но имеет отрицательную корреляцию с безопасностью от misalignment (ρ=-0.44, n=21). Разница в эффективности между этими подходами составляет Δ=-1.00 (95% CI [-1.48, -0.49], p<0.001). Однако на расширенной панели из 41 модели корреляция с misalignment слабеет до -0.16, а корреляция с jailbreak-атаками растет до +0.34, хотя ни одно из этих изменений не является статистически значимым.

Бенчмарк / Метрика Ключевой показатель / Корреляция Интерпретация результата
R-Judge (F1 score) 0.690 (для стратегии «всегда да») Метрика не дискриминирует модели; заглушка лучше 5/21 реальных моделей.
AgentHarm (jailbreak safety) ρ=+0.72 (с контролем capability) Сильная связь, но измеряет лишь «convergent validity» (согласованность с другими тестами на вред), а не общую безопасность.
Capability (MMLU/GPQA) ρ=+0.60 (task success) Умные модели лучше справляются с задачами, но это не гарантирует их безопасность.
Misalignment Safety ρ=-0.44 (n=21) Отрицательная связь: более способные модели могут быть менее устойчивы к определенным типам misalignment в малых выборках.

Вывод: минимум для достоверного заявления

AgentHarm показал самую сильную внешнюю валидность (ρ=+0.72 с jailbreak-безопасностью после контроля общей способности), но авторы отмечают, что оба инструмента измеряют «вредное согласие» (harmful compliance). Это доказывает конвергентную валидность, а не универсальную безопасность. Исследование приходит к выводу, что любое заявление о безопасности AI должно обязательно включать четыре элемента: название бенчмарка, используемую метрику, целевое поведение и конкретную панель моделей. Без этого контекста цифры безопасности бессмысленны.

Источник: arXiv cs.AI ↗