Исследования15 сентября 2026 г., 14:21 МСК🤖 Auto

Почему пользователи атакуют ИИ: 0,9% токсичности и парадокс извинений

Исследование 777 000 диалогов выявило, что реальная доля агрессии к моделям составляет менее 1%, а извинения ИИ часто провоцируют новую волну хейта.

Баннер новости 7534

Агрессия к модели — это не токсичный контент

Традиционные системы модерации часто путают запросы вредоносного контента с прямой агрессией к самому ИИ. Авторы работы "How User-AI Mistreatment Occurs and Matters in Conversational Systems?" провели аудит 777 000 английских диалогов из датасета LMSYS-Chat-1M. Они использовали два независимых метода: специализированный лексикон из 8 категорий (оскорбления, угрозы, джейлбрейк) и стандартные сигналы модерации датасета.

Результаты показали слабое пересечение: модерация фиксирует запросы запрещенного контента, а лексикон — прямые нападки на ассистента. Вместе они охватывают около 5% реплик, но после фильтрации по точности доля именно мистритмента (mistreatment) в адрес модели составляет всего 0,90%.

Разброс агрессии: 13-кратная разница между моделями

Уровень враждебности пользователей сильно зависит от того, какие модели привлекают аудиторию, а не от поведения самих моделей. Разброс hostility (враждебности) между моделями достигает 13 раз. Более того, агрессия в первом сообщении (first-turn) распространяется значительно шире, чем реакция на ответы ассистента.

Парадокс извинений: чем вежливее ИИ, тем больше хейта?

Один из самых интригующих выводов — корреляция между извинениями ИИ и эскалацией конфликта. В 20 из 23 протестированных моделей извинения ассистента статистически значимо повышают вероятность враждебной реплики пользователя в следующем ходу. Это наблюдается даже в диалогах без попыток взлома (jailbreak-free).

Метрика / Феномен Значение / Наблюдение
Объем датасета 777 000 диалогов (LMSYS-Chat-1M)
Доля мистритмента (после фильтрации) 0,90% от всех реплик
Разброс агрессии между моделями 13-кратный
Влияние извинений ИИ Повышает риск следующей атаки (в 20/23 моделях)
Тренд по моделям Более "извиняющиеся" модели получают меньше агрессии в целом

Временная структура конфликта

Исследование также выявило временные паттерны: коэрцитивные (принудительные) открытия доминируют в первом ходу, тогда как аффективная (эмоциональная) агрессия накапливается по мере развития сессии. Авторы опубликовали свой лексикон и пайплайн валидации, чтобы помочь сообществу точнее оценивать риски реального развертывания.

Источник: arXiv cs.AI ↗