Исследования1 сентября 2026 г., 02:18 МСК🤖 Auto

EvoHarmBench: LLM-модерация проигрывает 80% атак с имитацией человека

Исследователи представили EvoHarmBench — первую динамическую платформу для тестирования модерации контента. SOTA-модели пропускают 80.3% вредоносных запросов, адаптирующихся под обратную связь.

Баннер новости 6456

Проблема статических бенчмарков

Существующие методы оценки безопасности LLM опираются на статические наборы данных, которые не отражают реальную динамику платформ. В реальной среде пользователи не отправляют один запрос, а ведут диалог, адаптируя формулировки после каждого отказа модерации. Этот разрыв между офлайн-метриками и онлайн-эффективностью привел к созданию EvoHarmBench — первой системы динамической оценки, моделирующей интерактивную враждебную среду.

Методология: эволюция на уровне семантических кластеров

Фреймворк использует итеративный цикл оптимизации, который эволюционирует стратегии обхода на уровне семантических кластеров. Ключевая особенность — одновременная оптимизация двух параметров: успешности атаки и человеческой читаемости (human readability). Это позволяет генерировать промпты, которые выглядят естественно для пользователя, но обходят фильтры.

Масштаб исследования

Авторы проанализировали 5 002 реальных примера adversarial-запросов, собранных с контентных платформ. Данные распределены по 229 семантическим подкластерам в рамках пяти категорий нарушений. Тестированию подверглись LLM-модели защиты, широко используемые в индустрии.

Результаты: уязвимость лидеров рынка

Эксперименты выявили критические уязвимости даже в передовых коммерческих системах. После 12 итераций оптимизации, когда модель-атака учитывает обратную связь модератора, уровень успешности атак (Attack Success Rate) достигает 80.3% в рамках ограничений читаемости. Это означает, что в 8 из 10 случаев вредоносный контент, адаптированный под диалог, проходит модерацию.

Параметр Значение / Описание
Название фреймворка EvoHarmBench
Тип оценки Динамическая, интерактивная (iterative)
Объем данных 5 002 реальных adversarial-сэмплов
Семантические кластеры 229 подкластеров (5 категорий нарушений)
Количество итераций 12 шагов оптимизации
Успешность атаки (ASR) 80.3% (при сохранении читаемости)
Статус публикации Accepted to Findings of EMNLP 2026

Значение для индустрии

Исследование подчеркивает необходимость перехода от статического тестирования к динамическому adversarial-оцениванию. Авторы опубликуют полный набор данных, код и фреймворк, призывая сообщество пересмотреть стандарты безопасности LLM, которые сегодня часто дают ложное чувство защищенности.

Источник: arXiv cs.CL ↗