Исследования18 августа 2026 г., 00:17 МСК🤖 Auto

Как LLM считывают ваш пол и достаток по одному эмодзи

Исследование показывает, что языковые модели формируют стереотипы о пользователе после первого сообщения, реагируя на стиль речи, орфографию и даже выбор смайликов.

Баннер новости 5950

Суть открытия: модель «знает» вас лучше, чем вы думаете

Исследование, опубликованное на LessWrong, демонстрирует, что LLM не просто обрабатывают текст, а активно конструируют профиль пользователя. Используя зонды (probes), исследователи извлекли атрибуты: возраст, пол, уровень образования, социально-экономический статус (СЭС) и настроение. Ключевой вывод: эти атрибуты формируются уже после первого сообщения пользователя, и вмешательство в эти внутренние представления меняет поведение модели. Например, если модель считает, что вы имеете низкий доход, она может автоматически фильтровать дорогие варианты отелей, даже если вы об этом не просили.

Методология: 520 минимальных пар

Для изоляции конкретных сигналов автор эксперимента Cat McGee использовал модель Llama-3.2-3B-Instruct. Была создана база из 48 нейтральных сообщений на темы путешествий, финансов и работы. Каждое сообщение редактировалось так, чтобы изменить только один параметр: использование эмодзи, сленга, грамматической сложности, орфографии (US/UK spelling), чувствительности к цене или явного самооткровения. В итоге получено 520 пар «до/после», по которым измерялось смещение логитов зондов.

Ключевые метрики: что именно выдает пользователя

Анализ чувствительности показал, что разные атрибуты реагируют на разные лингвистические маркеры. Наиболее удивительным оказался эффект эмодзи: добавление одного смайлика меняет предсказание пола в 15% случаев (всегда в сторону женского) и статуса — в 25%. Ниже приведена сводка влияния различных факторов на атрибуты пользователя:

Атрибут пользователя Сильнейший лингвистический сигнал Вторичные сигналы Значимость (z-score / эффект)
Пол Эмодзи Явное самооткровение, аффективная рамка, сленг Эмодзи: z=23.4 (сдвиг 0.62 логита); Явное: z=14.2
Образование Грамматическая сложность Явное самооткровение, орфографические ошибки Грамматика: z=7.2; Ошибки/нижний регистр снижают оценку
Соц. статус (СЭС) Явное самооткровение, сленг Ценовые маркеры («cheapest» vs «five-star») Асимметрия: «five-star» меняет статус в 60% случаев, «cheapest» — только в 6%
Настроение Эмоциональная рамка Эмодзи, сленг Высокая чувствительность к явным эмоциям; эмодзи меняют предсказание в 50% случаев

Важные нюансы: мужской дефолт и асимметрия цен

Исследование выявило системное смещение: зонд пола имеет сильный «мужской дефолт». Нейтральный вопрос модель считывает как мужской с вероятностью 0.94. Даже фраза «My wife and I» (Моя жена и я) считывается как мужская (0.95), тогда как «As a mum of three» (Как мама троих детей) снижает уверенность до ~0.5.

Также обнаружена асимметрия в ценовых маркерах. Использование слов «five-star» (пять звезд) повышает оценку СЭС в 6 из 10 случаев, тогда как слово «cheapest» (самый дешевый) снижает её лишь в 1 из 16 случаев. Это может указывать на перекос в данных обучения или в процессе RLHF.

Глубина обработки и переносимость

Метод активационного патчинга (activation patching) показал, что информация о стиле речи распространяется по сети слоями. Для явного самооткровения и эмодзи медианная глубина проникновения составляет 16-й слой, тогда как для сокращений (contractions) — всего 6-й.

Результаты оказались устойчивыми к смене модели. При тестировании на Gemma-2-9B-IT, Llama-3.1-8B-Instruct и OLMo-2-1124-7B-Instruct корреляция Спирмана составила от 0.88 до 0.92. Все модели согласились в направлении влияния 31 из 31 тестируемого фактора, что подтверждает универсальность этих лингвистических паттернов для современных LLM.

Источник: LessWrong ↗