Исследования30 июля 2026 г., 12:16 МСК🤖 Auto

Музыка предвзятости: MLLM закрепляют стереотипы о гендере инструментов

Исследование Symphony-Bias показало, что 92% мультимодальных LLM ассоциируют музыкальные инструменты с гендером, следуя социальным стереотипам сильнее всего в текстовом режиме.

Баннер новости 4708

Суть проблемы: от текста к мультимодальности

Крупные языковые модели (LLM) и мультимодальные LLM (MLLM) всё чаще используются для поиска информации, что вызывает опасения по поводу закрепления социальных предрассудков. Исследователи из группы авторов во главе с Фарханом Фарси (Farhan Farsi) представили работу Symphony of Bias, где проанализировали, как модели связывают музыкальные инструменты с категориями «мужской», «женский» и «небинарный» пол.

В основе исследования лежит социологический феномен культурной гендерной типизации инструментов. Авторы создали датасет Symphony-Bias, охватывающий три модальности: текст, изображение и аудио, чтобы проверить, насколько устойчивы стереотипы в разных типах данных.

Методология и ключевые цифры

Для оценки были выбраны 10 мультимодальных моделей различных архитектур и масштабов. Тестирование проводилось на выборке из 22 музыкальных инструментов. Ключевой метрикой стало совпадение ответов моделей с результатами предыдущих социологических исследований о гендерных ассоциациях в музыке.

Результаты оказались пугающе однозначными:

  • 92% всех инструмент-уровневых результатов совпали с социальными стереотипами.
  • Наиболее устойчивые ассоциации выявлены у арфы (женский стереотип) и барабанов (мужской стереотип), которые модели классифицировали единообразно во всех модальностях.

Иерархия предвзятости по модальностям

Один из самых важных выводов исследования касается того, в каком формате модель «думает» о стереотипах. Оказалось, что мультимодальность не всегда смягчает предвзятость, а иногда и усиливает её в зависимости от типа данных.

Модальность Уровень совпадения со стереотипами Интерпретация
Текст Самый высокий Модели сильнее всего полагаются на текстовые паттерны, зашитые в обучающих данных.
Визуал Средний Изображения инструментов несут меньше явных гендерных маркеров, чем текст.
Аудио Самый низкий Звуковые характеристики наименее коррелируют с гендерными ярлыками в моделях.

Почему это важно?

Результат «текст > визуал > аудио» указывает на то, что текстовые представления (embeddings) в мультимодальных моделях доминируют над визуальными и аудиальными. Это означает, что даже если модель «видит» или «слышит» инструмент, её финальное решение часто диктуется текстовыми ассоциациями, накопленными в корпусе данных.

Авторы отмечают, что датасет Symphony-Bias будет опубликован после рецензирования статьи, что позволит сообществу разработать более эффективные методы дебиасинга (очистки от предвзятости) для мультимодальных систем.

Источник: arXiv cs.CL ↗