Проблема «усреднения» в NLP
Традиционные системы обработки естественного языка (NLP) при обучении детекторам токсичности часто игнорируют расхождения во мнениях аннотаторов, сводя их к простому большинству голосов. Однако исследователи из команды Hadi Mohammadi, Tina Shahedi и коллег утверждают, что разногласия в оценке сексизма — это не ошибка, а отражение разных перспектив. Для решения этой проблемы они разработали фреймворк MAP-PO (Multi-Agent Perspectivist Preference Optimization).
Методология: Кластеризация по поведению, а не демографии
Вместо того чтобы группировать людей по полу или возрасту, авторы кластеризуют аннотаторов на основе их поведения при маркировке текста. На датасете EXIST 2024 (англоязычные и испаноязычные твиты) создается отдельный агент Large Language Model (LLM) для каждого кластера. Эти агенты обучаются воспроизводить стиль маркировки своей группы, а не усредненный результат.
Ключевые экспериментальные результаты
Оценка проводилась в четырех конфигурациях (два языка × две базовые модели). Исследование выявило два критических факта:
- Необходимость дообучения: Без специфического дообучения все агенты ведут себя практически идентично, теряя уникальность перспективы.
- Важность командного сигнала: Обучение только на метках своего кластера «уводит» агента слишком далеко от репрезентативности. Добавление общего сигнала уровня команды (team-level reward) удерживает агентов в границах их кластера, обеспечивая калибровку.
Значение для индустрии
Подход MAP-PO меняет парадигму создания фильтров контента. Вместо создания одного «объективного» детектора, который может быть предвзят к определенной норме, система предлагает мультиагентную архитектуру, учитывающую культурные и социальные нюансы восприятия токсичности. Работа находится на рецензировании в EACL 2027 (август 2026).
Источник: arXiv cs.CL ↗
