Исследования1 июля 2026 г., 00:18 МСК🤖 Auto

Голосование большинства убивает контекст: почему AI не видит грань между оскорблением и ненавистью

Исследование HateXplain показывает, что стандартная практика аннотирования данных через majority vote скрывает 42,6% спорных случаев, заставляя модели быть уверенно ошибочными на границе между оскорблением и разжиганием ненависти.

Баннер новости 2628

Проблема «серой зоны» в аннотации

Традиционные пайплайны обучения моделей обработки естественного языка (NLP) часто агрегируют мнения аннотаторов, превращая разногласия в единую метку на основе большинства. Исследование авторов Joshua Muhumuza, Joab Ezra Agaba и Mercy Amiyo демонстрирует, что этот процесс не нейтрален. 42,6% всех разногласий в датасете HateXplain концентрируется именно на границе между «оскорблением» (offensive) и «разжиганием ненависти» (hate). Статистическая значимость этого паттерна подтверждена тестом хи-квадрат: χ² = 135.199, df = 2, p < 0.0001.

Это означает, что аннотаторы применяют разные пороги чувствительности: то, что один считает допустимой грубостью, другой классифицирует как угрозу. Схлопывание этих мнений в одну метку стирает культурный и контекстуальный нюанс.

Эксперимент: три модели, одна катастрофа

Авторы протестировали три подхода к обучению на данных с разногласиями. Результаты показали, что стандартные метрики оценки (accuracy) не способны выявить критические сбои модели на спорных примерах.

Модель Тип обучения Точность на согласных постах Точность на спорных постах Уверенность при ошибке
Model A Hard-label (BERT) ~80% ~58% 0.710
Model B Soft-label ~80% ~58% Информация недостаточна
Model C Per-annotator multi-head Информация недостаточна ~30% (падение на 28 п.п.) 0.495

Ключевой вывод: Model A (стандартный BERT с жесткими лейблами) демонстрирует высокую уверенность (0.710) даже когда ошибается на границе hate/offensive. Модель C, учитывающая мнения отдельных аннотаторов, снижает эту ложную уверенность до 0.495, но при этом точность на спорных случаях падает до 0.245 (24.5%).

Почему это структурная проблема

Три последующих вмешательства (downstream interventions) различной сложности не смогли восстановить точность на границе классов. Авторы утверждают, что проблема не в архитектуре модели, а в дизайне аннотации. Представление оспоренного суждения как «истины в последней инстанции» (ground truth) заставляет модели наследовать ложную уверенность.

Решение должно быть внедрено на этапе проектирования аннотации (upstream), а не в постобработке результатов моделирования.

Источник: arXiv cs.CL ↗