Проблема «одного решения для всех»
Скрытая ненависть (implicit hate speech) маскируется под обычные высказывания, используя метафоры и контекстные намёки. Существующие модели на базе PLM и LLM часто применяют единый процесс рассуждения ко всем примерам. Это приводит к избыточным вычислениям на простых случаях и пропуску тонких лингвистических нюансов в сложных.
Три уровня скрытой агрессии
Авторы (Han Wang, Yuhu Cheng, Xuesong Wang, Yi Zhu) предлагают разделить контент на три категории, требующие разного подхода:
- Shallow (Поверхностные): Намерение очевидно по формулировкам, но без прямой брани.
- Targeted (Целевые): Злоба привязана к скрытой цели, требующей извлечения знаний.
- Context-Dependent (Зависимые от контекста): Отсутствие фона делает намерение неоднозначным.
Архитектура FAID: Скальпель вместо молота
Фреймворк Fine-grained Adaptive Implicit Hate speech Detection (FAID) динамически выбирает инструмент:
- Для Shallow используется легковесный prompt-tuning для мгновенной классификации.
- Для Targeted применяется аугментация знаний, итеративно раскрывающая скрытые цели.
- Для Context-Dependent задействуется агентная система, генерирующая промпты для восполнения недостающего контекста и вывода намерений.
Результаты и значимость
Эксперименты на четырех бенчмарках показали, что FAID превосходит текущие SOTA-базовые модели. Подход позволяет не тратить вычислительные мощности LLM на простые случаи, фокусируя их только на сложных, скрытых формах агрессии.
| Тип скрытой ненависти | Характеристика | Метод обработки в FAID |
|---|---|---|
| Shallow | Поверхностное намерение | Легковесный prompt-tuning |
| Targeted | Скрытая цель | Аугментация знаний |
| Context-Dependent | Нехватка фона | Агентная генерация контекста |
Источник: arXiv cs.CL ↗
