Суть проблемы: от текста к мультимодальности
Крупные языковые модели (LLM) и мультимодальные LLM (MLLM) всё чаще используются для поиска информации, что вызывает опасения по поводу закрепления социальных предрассудков. Исследователи из группы авторов во главе с Фарханом Фарси (Farhan Farsi) представили работу Symphony of Bias, где проанализировали, как модели связывают музыкальные инструменты с категориями «мужской», «женский» и «небинарный» пол.
В основе исследования лежит социологический феномен культурной гендерной типизации инструментов. Авторы создали датасет Symphony-Bias, охватывающий три модальности: текст, изображение и аудио, чтобы проверить, насколько устойчивы стереотипы в разных типах данных.
Методология и ключевые цифры
Для оценки были выбраны 10 мультимодальных моделей различных архитектур и масштабов. Тестирование проводилось на выборке из 22 музыкальных инструментов. Ключевой метрикой стало совпадение ответов моделей с результатами предыдущих социологических исследований о гендерных ассоциациях в музыке.
Результаты оказались пугающе однозначными:
- 92% всех инструмент-уровневых результатов совпали с социальными стереотипами.
- Наиболее устойчивые ассоциации выявлены у арфы (женский стереотип) и барабанов (мужской стереотип), которые модели классифицировали единообразно во всех модальностях.
Иерархия предвзятости по модальностям
Один из самых важных выводов исследования касается того, в каком формате модель «думает» о стереотипах. Оказалось, что мультимодальность не всегда смягчает предвзятость, а иногда и усиливает её в зависимости от типа данных.
| Модальность | Уровень совпадения со стереотипами | Интерпретация |
|---|---|---|
| Текст | Самый высокий | Модели сильнее всего полагаются на текстовые паттерны, зашитые в обучающих данных. |
| Визуал | Средний | Изображения инструментов несут меньше явных гендерных маркеров, чем текст. |
| Аудио | Самый низкий | Звуковые характеристики наименее коррелируют с гендерными ярлыками в моделях. |
Почему это важно?
Результат «текст > визуал > аудио» указывает на то, что текстовые представления (embeddings) в мультимодальных моделях доминируют над визуальными и аудиальными. Это означает, что даже если модель «видит» или «слышит» инструмент, её финальное решение часто диктуется текстовыми ассоциациями, накопленными в корпусе данных.
Авторы отмечают, что датасет Symphony-Bias будет опубликован после рецензирования статьи, что позволит сообществу разработать более эффективные методы дебиасинга (очистки от предвзятости) для мультимодальных систем.
Источник: arXiv cs.CL ↗
