Агрессия к модели — это не токсичный контент
Традиционные системы модерации часто путают запросы вредоносного контента с прямой агрессией к самому ИИ. Авторы работы "How User-AI Mistreatment Occurs and Matters in Conversational Systems?" провели аудит 777 000 английских диалогов из датасета LMSYS-Chat-1M. Они использовали два независимых метода: специализированный лексикон из 8 категорий (оскорбления, угрозы, джейлбрейк) и стандартные сигналы модерации датасета.
Результаты показали слабое пересечение: модерация фиксирует запросы запрещенного контента, а лексикон — прямые нападки на ассистента. Вместе они охватывают около 5% реплик, но после фильтрации по точности доля именно мистритмента (mistreatment) в адрес модели составляет всего 0,90%.
Разброс агрессии: 13-кратная разница между моделями
Уровень враждебности пользователей сильно зависит от того, какие модели привлекают аудиторию, а не от поведения самих моделей. Разброс hostility (враждебности) между моделями достигает 13 раз. Более того, агрессия в первом сообщении (first-turn) распространяется значительно шире, чем реакция на ответы ассистента.
Парадокс извинений: чем вежливее ИИ, тем больше хейта?
Один из самых интригующих выводов — корреляция между извинениями ИИ и эскалацией конфликта. В 20 из 23 протестированных моделей извинения ассистента статистически значимо повышают вероятность враждебной реплики пользователя в следующем ходу. Это наблюдается даже в диалогах без попыток взлома (jailbreak-free).
| Метрика / Феномен | Значение / Наблюдение |
|---|---|
| Объем датасета | 777 000 диалогов (LMSYS-Chat-1M) |
| Доля мистритмента (после фильтрации) | 0,90% от всех реплик |
| Разброс агрессии между моделями | 13-кратный |
| Влияние извинений ИИ | Повышает риск следующей атаки (в 20/23 моделях) |
| Тренд по моделям | Более "извиняющиеся" модели получают меньше агрессии в целом |
Временная структура конфликта
Исследование также выявило временные паттерны: коэрцитивные (принудительные) открытия доминируют в первом ходу, тогда как аффективная (эмоциональная) агрессия накапливается по мере развития сессии. Авторы опубликовали свой лексикон и пайплайн валидации, чтобы помочь сообществу точнее оценивать риски реального развертывания.
Источник: arXiv cs.AI ↗
