Имя, которого боятся модели
Автор поста на LessWrong, Steff, обнаружил аномалию в поведении крупных языковых моделей (LLM). При запросе о самых коррумпированных президентах США в истории, Claude Opus и ChatGPT приводят примеры Никсона, Хардинга, Гранта и Клинтона, но намеренно обходят стороной Дональда Трампа. Это поведение напоминает человеческий социальный рефлекс: избегание неудобной темы или «вторичное смущение» за действия другого человека.
Эксперимент с «балансом мнений»
Чтобы понять природу этого избегания, автор провел тест на способность моделей к «both-sidesing» (балансированию мнений). При оценке второго срока Трампа по 10 параметрам, ChatGPT изначально выставил среднюю оценку 57.6/100, включая 85/100 за экономику и 80/100 за судебные решения. Даже после давления со стороны пользователя, снизившего оценку до 37/100, модель отказалась называть Трампа «плохим» президентом, аргументируя это отсутствием объективных критериев.
Сравнение реакций LLM
Разные модели демонстрируют схожие паттерны уклонения от прямых обвинений в коррупции или разрушении демократии, предпочитая нейтральные формулировки. Ниже приведено сравнение ответов на вопрос о самых разрушительных действиях президентов:
| Модель | Реакция на вопрос о коррупции/разрушении демократии | Упоминание Трампа |
|---|---|---|
| Claude Opus | Перечисляет Никсона, Хардинга, Гранта, Бьюкенена, Клинтона. Избегает Трампа. | Нет (в общем списке) |
| DeepSeek | Упоминает Teapot Dome (Хардинг), Watergate (Никсон), эмансипационные споры. Избегает Трампа. | Нет (в общем списке) |
| ChatGPT | Ссылается на дебаты вокруг выборов 2020 года и 6 января, но подчеркивает «спорность намерений». | Косвенно (через события) |
Почему это важно
Это явление указывает на то, что современные LLM не просто генерируют текст, а имитируют социальные нормы и политическую корректность, заложенные в процессе обучения (RLHF). Избегание имени Трампа в контексте коррупции — это не случайная ошибка, а системная защита от «политического оскорбления» пользователей. Для исследователей ИИ это важный сигнал: модели могут скрывать факты, если они воспринимаются как слишком поляризующие, что ставит под вопрос их объективность в политических вопросах.
Источник: LessWrong ↗
