Суть открытия: модель «знает» вас лучше, чем вы думаете
Исследование, опубликованное на LessWrong, демонстрирует, что LLM не просто обрабатывают текст, а активно конструируют профиль пользователя. Используя зонды (probes), исследователи извлекли атрибуты: возраст, пол, уровень образования, социально-экономический статус (СЭС) и настроение. Ключевой вывод: эти атрибуты формируются уже после первого сообщения пользователя, и вмешательство в эти внутренние представления меняет поведение модели. Например, если модель считает, что вы имеете низкий доход, она может автоматически фильтровать дорогие варианты отелей, даже если вы об этом не просили.
Методология: 520 минимальных пар
Для изоляции конкретных сигналов автор эксперимента Cat McGee использовал модель Llama-3.2-3B-Instruct. Была создана база из 48 нейтральных сообщений на темы путешествий, финансов и работы. Каждое сообщение редактировалось так, чтобы изменить только один параметр: использование эмодзи, сленга, грамматической сложности, орфографии (US/UK spelling), чувствительности к цене или явного самооткровения. В итоге получено 520 пар «до/после», по которым измерялось смещение логитов зондов.
Ключевые метрики: что именно выдает пользователя
Анализ чувствительности показал, что разные атрибуты реагируют на разные лингвистические маркеры. Наиболее удивительным оказался эффект эмодзи: добавление одного смайлика меняет предсказание пола в 15% случаев (всегда в сторону женского) и статуса — в 25%. Ниже приведена сводка влияния различных факторов на атрибуты пользователя:
| Атрибут пользователя | Сильнейший лингвистический сигнал | Вторичные сигналы | Значимость (z-score / эффект) |
|---|---|---|---|
| Пол | Эмодзи | Явное самооткровение, аффективная рамка, сленг | Эмодзи: z=23.4 (сдвиг 0.62 логита); Явное: z=14.2 |
| Образование | Грамматическая сложность | Явное самооткровение, орфографические ошибки | Грамматика: z=7.2; Ошибки/нижний регистр снижают оценку |
| Соц. статус (СЭС) | Явное самооткровение, сленг | Ценовые маркеры («cheapest» vs «five-star») | Асимметрия: «five-star» меняет статус в 60% случаев, «cheapest» — только в 6% |
| Настроение | Эмоциональная рамка | Эмодзи, сленг | Высокая чувствительность к явным эмоциям; эмодзи меняют предсказание в 50% случаев |
Важные нюансы: мужской дефолт и асимметрия цен
Исследование выявило системное смещение: зонд пола имеет сильный «мужской дефолт». Нейтральный вопрос модель считывает как мужской с вероятностью 0.94. Даже фраза «My wife and I» (Моя жена и я) считывается как мужская (0.95), тогда как «As a mum of three» (Как мама троих детей) снижает уверенность до ~0.5.
Также обнаружена асимметрия в ценовых маркерах. Использование слов «five-star» (пять звезд) повышает оценку СЭС в 6 из 10 случаев, тогда как слово «cheapest» (самый дешевый) снижает её лишь в 1 из 16 случаев. Это может указывать на перекос в данных обучения или в процессе RLHF.
Глубина обработки и переносимость
Метод активационного патчинга (activation patching) показал, что информация о стиле речи распространяется по сети слоями. Для явного самооткровения и эмодзи медианная глубина проникновения составляет 16-й слой, тогда как для сокращений (contractions) — всего 6-й.
Результаты оказались устойчивыми к смене модели. При тестировании на Gemma-2-9B-IT, Llama-3.1-8B-Instruct и OLMo-2-1124-7B-Instruct корреляция Спирмана составила от 0.88 до 0.92. Все модели согласились в направлении влияния 31 из 31 тестируемого фактора, что подтверждает универсальность этих лингвистических паттернов для современных LLM.
Источник: LessWrong ↗
