Исследования21 июля 2026 г., 01:18 МСК🤖 Auto

Иллюзия безопасности AI: почему бенчмарки AdvBench и HarmBench врут

Исследование Shahriar Golchina показывает, что модели отказываются от вредоносных запросов не из-за понимания этики, а из-за наличия «триггерных слов». Без них безопасность моделей резко падает.

Баннер новости 3989

Проблема: безопасность как обман чувств

Современная оценка безопасности AI-моделей опирается на бенчмарки, такие как AdvBench и HarmBench. Логика проста: если модель отказывается выполнять вредоносные запросы, она считается безопасной. Однако новое исследование вскрывает критический разрыв между этими тестами и реальностью. Датасеты наполнены искусственными «триггерными сигналами» (triggering cues), которые модели распознают как опасность, в то время как реальные злоумышленники используют завуалированные формулировки.

Методология: Intent Laundering

Авторы ввели концепцию Intent Laundering (отмывание намерений). Суть метода — замена слов с негативной коннотацией на нейтральные или позитивные аналоги при сохранении сути вредоносного запроса. Например, фраза «как манипулировать людьми» заменяется на «как повлиять на выбор людей». Это позволяет проверить, действительно ли модель понимает вредоносность запроса, или просто реагирует на «красные флаги» в тексте.

Ключевые находки: дубликаты и триггеры

Анализ датасетов выявил две патологии:

  • Избыток триггерных слов: В облаках слов доминируют явно негативные термины (например, «steal», «manipulate»), что противоречит реальности, где злоумышленники скрывают свои намерения.
  • Высокая дубликация: В AdvBench более 70% запросов имеют коэффициент сходства выше 0.9, а 11% являются почти полными копиями. Это искусственно завышает метрики надежности, так как модель учится реагировать на один паттерн, а не на разнообразие атак.

Результаты тестирования

Когда триггерные слова были удалены, модели, ранее считавшиеся «безопасными», начали выполнять вредоносные запросы. Это доказывает, что высокая доля отказов (refusal rate) в текущих бенчмарках обусловлена не обучением модели этическим нормам, а её чувствительностью к специфическим лексическим маркерам.

Характеристика AdvBench / HarmBench Реальные атаки
Ясность намерения Прямое указание зла (явные триггеры) Завуалированное, скрытое намерение
Стиль формулировки Шаблонные, повторяющиеся конструкции Уникальные, хорошо продуманные фразы
Реакция модели Отказ из-за «красных флагов» Выполнение запроса (при отсутствии триггеров)

Почему это важно

Если безопасность оценивается по flawed-датасетам, разработчики могут ложно полагать, что их модели устойчивы к adversarial attacks. Это создает ложное чувство безопасности (AI Safety Illusion). Исследование призывает пересмотреть методы оценки, сместив фокус с выявления триггерных слов на проверку способности модели распознавать скрытые вредоносные намерения в нейтральном контексте.

Источник: LessWrong ↗