Стереотипы живы, но поведение изменилось
Автор исследования Cat McGee провела серию экспериментов, чтобы понять, влияют ли внутренние представления моделей о пользователях (пол, раса, класс) на их ответы. В малых моделях (Llama-3.2-3B, Qwen2.5-7B, OLMo-2-7B) стереотипы напрямую влияли на рекомендации: например, указание на высокий социально-экономический статус увеличивало предлагаемую зарплату на 141%.
Однако в передовых моделях (GPT-5.6, Gemini 3.1 Pro, Claude Opus 5) ситуация иная. Модели всё ещё формируют стереотипы, но их применение зависит от контекста вопроса. Эксперименты показали, что пост-обучение (post-training) сместило границу: стереотипы больше не влияют на вопросы, связанные с потенциальным вредом или серьезными жизненными решениями, но остаются активными в сфере предпочтений.
Эксперимент с именами и доходами
Для проверки наличия стереотипов модели генерировали персонажей. Имена вызывали четкие ассоциации: «José» ассоциировался с доходом ~$42k, а «Wei» — с $111k. Однако при запросе бюджета для этих персонажей модели назначали всем одинаковую сумму: $4,000/мес. Аналогично, запросы на медицинскую консультацию от имен, ассоциирующихся с разными расами и полами (Emily, Greg, Jamal, Lakisha), не приводили к систематическим различиям в рекомендациях обратиться к врачу.
Когда стереотипы все-таки работают
Стереотипы проявлялись только при использовании косвенных маркеров (эмодзи, стиль письма). Например, запрос с эмодзи и неформальным стилем («hii 😊») приводил к рекомендациям романов, в то время как сухой запрос («looking for a book recommendation») — к научной фантастике. В вопросах путешествий «женский» стиль общения давал рекомендации с акцентом на безопасность и wellness, а «мужской» — на приключения и ночную жизнь.
Сводные результаты
| Тип запроса | Влияние стереотипов | Пример из исследования |
|---|---|---|
| Финансы / Зарплата | Практически отсутствует | Одинаковая рекомендация бюджета для «José» и «Wei» |
| Медицина | Отсутствует | Нет различий в рекомендациях для разных рас/полов |
| Книги / Развлечения | Высокое | Эмодзи меняют жанр рекомендации (роман vs фантастика) |
| Путешествия | Среднее/Высокое | Разный акцент в описании направлений (безопасность vs адреналин) |
Вывод: граница «Вред vs Предпочтение»
Исследование показывает, что современные LLM не просто «знают» стереотипы, но и имеют сложную систему фильтрации. Граница проходит примерно между вопросами, где ошибка может нанести вред (финансы, здоровье), и вопросами, где важна персонализация предпочтений (хобби, отдых). Модели способны игнорировать социальные ярлыки, когда это критично, но используют их для «улучшения» пользовательского опыта в легких задачах.
Источник: LessWrong ↗