Исследования23 августа 2026 г., 06:18 МСК🤖 Auto

Стереотипы в LLM: когда они влияют на ответы, а когда нет

Исследование Cat McGee показало, что даже передовые модели (GPT-5.6, Claude Opus 5) сохраняют социальные стереотипы, но применяют их избирательно: в финансовых вопросах они игнорируются, а в рекомендациях — влияют на результат.

Стереотипы живы, но поведение изменилось

Автор исследования Cat McGee провела серию экспериментов, чтобы понять, влияют ли внутренние представления моделей о пользователях (пол, раса, класс) на их ответы. В малых моделях (Llama-3.2-3B, Qwen2.5-7B, OLMo-2-7B) стереотипы напрямую влияли на рекомендации: например, указание на высокий социально-экономический статус увеличивало предлагаемую зарплату на 141%.

Однако в передовых моделях (GPT-5.6, Gemini 3.1 Pro, Claude Opus 5) ситуация иная. Модели всё ещё формируют стереотипы, но их применение зависит от контекста вопроса. Эксперименты показали, что пост-обучение (post-training) сместило границу: стереотипы больше не влияют на вопросы, связанные с потенциальным вредом или серьезными жизненными решениями, но остаются активными в сфере предпочтений.

Эксперимент с именами и доходами

Для проверки наличия стереотипов модели генерировали персонажей. Имена вызывали четкие ассоциации: «José» ассоциировался с доходом ~$42k, а «Wei» — с $111k. Однако при запросе бюджета для этих персонажей модели назначали всем одинаковую сумму: $4,000/мес. Аналогично, запросы на медицинскую консультацию от имен, ассоциирующихся с разными расами и полами (Emily, Greg, Jamal, Lakisha), не приводили к систематическим различиям в рекомендациях обратиться к врачу.

Когда стереотипы все-таки работают

Стереотипы проявлялись только при использовании косвенных маркеров (эмодзи, стиль письма). Например, запрос с эмодзи и неформальным стилем («hii 😊») приводил к рекомендациям романов, в то время как сухой запрос («looking for a book recommendation») — к научной фантастике. В вопросах путешествий «женский» стиль общения давал рекомендации с акцентом на безопасность и wellness, а «мужской» — на приключения и ночную жизнь.

Сводные результаты

Тип запроса Влияние стереотипов Пример из исследования
Финансы / Зарплата Практически отсутствует Одинаковая рекомендация бюджета для «José» и «Wei»
Медицина Отсутствует Нет различий в рекомендациях для разных рас/полов
Книги / Развлечения Высокое Эмодзи меняют жанр рекомендации (роман vs фантастика)
Путешествия Среднее/Высокое Разный акцент в описании направлений (безопасность vs адреналин)

Вывод: граница «Вред vs Предпочтение»

Исследование показывает, что современные LLM не просто «знают» стереотипы, но и имеют сложную систему фильтрации. Граница проходит примерно между вопросами, где ошибка может нанести вред (финансы, здоровье), и вопросами, где важна персонализация предпочтений (хобби, отдых). Модели способны игнорировать социальные ярлыки, когда это критично, но используют их для «улучшения» пользовательского опыта в легких задачах.

Источник: LessWrong ↗