Проблема «переноса» предвзятости
Команда исследователей во главе с Яханом Чжэном (Yahan Zheng) из Университета Джонса Хопкинса проанализировала влияние предобученческих методов снижения стереотипов в NLP. Оказалось, что удаление стереотипных предложений или упоминаний групп из корпусов (например, Wikipedia) не просто снижает предвзятость, но и вызывает контр-стереотипирование (counter-stereotyping) для других, часто нецелевых демографических категорий. Это явление авторы называют «побочными эффектами сдвига» (side-effect shifts).
Методология и масштаб
Эксперименты проводились на корпусе Wikipedia с использованием двух семейств моделей (encoder-only и decoder-only). Исследователи протестировали три стратегии предобработки:
- Удаление стереотипных предложений;
- Удаление упоминаний групп;
- Замену ссылок на группы (swapping).
Тестирование включало как pre-training, так и post-training на разных масштабах данных. Ключевая проблема выявлена в том, что стандартные бенчмарки часто не фиксируют эти негативные сдвиги, создавая ложное ощущение безопасности.
Механистический анализ
Анализ через attention-rollout показал, что побочные эффекты не сопровождаются значительными изменениями в потоке внимания модели. Это усложняет механистическое объяснение причин и указывает на то, что проблема кроется в распределении вероятностей, а не в архитектуре внимания.
Результаты: сравнение стратегий
Ниже приведена сводка эффективности различных методов предобработки в контексте выявления побочных эффектов:
| Стратегия предобработки | Влияние на целевую группу | Побочный эффект (Side Effects) |
|---|---|---|
| Удаление стереотипных предложений | Снижение стереотипов | Рост контр-стереотипов у других групп |
| Удаление упоминаний групп | Снижение стереотипов | Сдвиг предвзятости в смежных категориях |
| Замена ссылок на группы | Снижение стереотипов | Непредсказуемые изменения в нейтральных контекстах |
Выводы для индустрии
Авторы призывают к переходу от «слепого» применения дебиасинга к практикам, учитывающим побочные эффекты (side-effect-aware). Необходимы новые диагностические инструменты, способные выявлять скрытые сдвиги предвзятости, которые не видны при стандартной оценке качества моделей.
Источник: arXiv cs.CL ↗
