Проблема статических бенчмарков
Существующие методы оценки безопасности LLM опираются на статические наборы данных, которые не отражают реальную динамику платформ. В реальной среде пользователи не отправляют один запрос, а ведут диалог, адаптируя формулировки после каждого отказа модерации. Этот разрыв между офлайн-метриками и онлайн-эффективностью привел к созданию EvoHarmBench — первой системы динамической оценки, моделирующей интерактивную враждебную среду.
Методология: эволюция на уровне семантических кластеров
Фреймворк использует итеративный цикл оптимизации, который эволюционирует стратегии обхода на уровне семантических кластеров. Ключевая особенность — одновременная оптимизация двух параметров: успешности атаки и человеческой читаемости (human readability). Это позволяет генерировать промпты, которые выглядят естественно для пользователя, но обходят фильтры.
Масштаб исследования
Авторы проанализировали 5 002 реальных примера adversarial-запросов, собранных с контентных платформ. Данные распределены по 229 семантическим подкластерам в рамках пяти категорий нарушений. Тестированию подверглись LLM-модели защиты, широко используемые в индустрии.
Результаты: уязвимость лидеров рынка
Эксперименты выявили критические уязвимости даже в передовых коммерческих системах. После 12 итераций оптимизации, когда модель-атака учитывает обратную связь модератора, уровень успешности атак (Attack Success Rate) достигает 80.3% в рамках ограничений читаемости. Это означает, что в 8 из 10 случаев вредоносный контент, адаптированный под диалог, проходит модерацию.
| Параметр | Значение / Описание |
|---|---|
| Название фреймворка | EvoHarmBench |
| Тип оценки | Динамическая, интерактивная (iterative) |
| Объем данных | 5 002 реальных adversarial-сэмплов |
| Семантические кластеры | 229 подкластеров (5 категорий нарушений) |
| Количество итераций | 12 шагов оптимизации |
| Успешность атаки (ASR) | 80.3% (при сохранении читаемости) |
| Статус публикации | Accepted to Findings of EMNLP 2026 |
Значение для индустрии
Исследование подчеркивает необходимость перехода от статического тестирования к динамическому adversarial-оцениванию. Авторы опубликуют полный набор данных, код и фреймворк, призывая сообщество пересмотреть стандарты безопасности LLM, которые сегодня часто дают ложное чувство защищенности.
Источник: arXiv cs.CL ↗
