Проблема «серой зоны» в аннотации
Традиционные пайплайны обучения моделей обработки естественного языка (NLP) часто агрегируют мнения аннотаторов, превращая разногласия в единую метку на основе большинства. Исследование авторов Joshua Muhumuza, Joab Ezra Agaba и Mercy Amiyo демонстрирует, что этот процесс не нейтрален. 42,6% всех разногласий в датасете HateXplain концентрируется именно на границе между «оскорблением» (offensive) и «разжиганием ненависти» (hate). Статистическая значимость этого паттерна подтверждена тестом хи-квадрат: χ² = 135.199, df = 2, p < 0.0001.
Это означает, что аннотаторы применяют разные пороги чувствительности: то, что один считает допустимой грубостью, другой классифицирует как угрозу. Схлопывание этих мнений в одну метку стирает культурный и контекстуальный нюанс.
Эксперимент: три модели, одна катастрофа
Авторы протестировали три подхода к обучению на данных с разногласиями. Результаты показали, что стандартные метрики оценки (accuracy) не способны выявить критические сбои модели на спорных примерах.
| Модель | Тип обучения | Точность на согласных постах | Точность на спорных постах | Уверенность при ошибке |
|---|---|---|---|---|
| Model A | Hard-label (BERT) | ~80% | ~58% | 0.710 |
| Model B | Soft-label | ~80% | ~58% | Информация недостаточна |
| Model C | Per-annotator multi-head | Информация недостаточна | ~30% (падение на 28 п.п.) | 0.495 |
Ключевой вывод: Model A (стандартный BERT с жесткими лейблами) демонстрирует высокую уверенность (0.710) даже когда ошибается на границе hate/offensive. Модель C, учитывающая мнения отдельных аннотаторов, снижает эту ложную уверенность до 0.495, но при этом точность на спорных случаях падает до 0.245 (24.5%).
Почему это структурная проблема
Три последующих вмешательства (downstream interventions) различной сложности не смогли восстановить точность на границе классов. Авторы утверждают, что проблема не в архитектуре модели, а в дизайне аннотации. Представление оспоренного суждения как «истины в последней инстанции» (ground truth) заставляет модели наследовать ложную уверенность.
Решение должно быть внедрено на этапе проектирования аннотации (upstream), а не в постобработке результатов моделирования.
Источник: arXiv cs.CL ↗
