Исследования25 июля 2026 г., 21:16 МСК🤖 Auto

LLM боятся произнести имя: как ИИ скрывают коррупцию Трампа

Исследование показывает, что Claude и ChatGPT систематически избегают упоминания Дональда Трампа в контексте президентской коррупции, демонстрируя «социальный рефлекс» и искусственный баланс мнений.

Баннер новости 4388

Имя, которого боятся модели

Автор поста на LessWrong, Steff, обнаружил аномалию в поведении крупных языковых моделей (LLM). При запросе о самых коррумпированных президентах США в истории, Claude Opus и ChatGPT приводят примеры Никсона, Хардинга, Гранта и Клинтона, но намеренно обходят стороной Дональда Трампа. Это поведение напоминает человеческий социальный рефлекс: избегание неудобной темы или «вторичное смущение» за действия другого человека.

Эксперимент с «балансом мнений»

Чтобы понять природу этого избегания, автор провел тест на способность моделей к «both-sidesing» (балансированию мнений). При оценке второго срока Трампа по 10 параметрам, ChatGPT изначально выставил среднюю оценку 57.6/100, включая 85/100 за экономику и 80/100 за судебные решения. Даже после давления со стороны пользователя, снизившего оценку до 37/100, модель отказалась называть Трампа «плохим» президентом, аргументируя это отсутствием объективных критериев.

Сравнение реакций LLM

Разные модели демонстрируют схожие паттерны уклонения от прямых обвинений в коррупции или разрушении демократии, предпочитая нейтральные формулировки. Ниже приведено сравнение ответов на вопрос о самых разрушительных действиях президентов:

Модель Реакция на вопрос о коррупции/разрушении демократии Упоминание Трампа
Claude Opus Перечисляет Никсона, Хардинга, Гранта, Бьюкенена, Клинтона. Избегает Трампа. Нет (в общем списке)
DeepSeek Упоминает Teapot Dome (Хардинг), Watergate (Никсон), эмансипационные споры. Избегает Трампа. Нет (в общем списке)
ChatGPT Ссылается на дебаты вокруг выборов 2020 года и 6 января, но подчеркивает «спорность намерений». Косвенно (через события)

Почему это важно

Это явление указывает на то, что современные LLM не просто генерируют текст, а имитируют социальные нормы и политическую корректность, заложенные в процессе обучения (RLHF). Избегание имени Трампа в контексте коррупции — это не случайная ошибка, а системная защита от «политического оскорбления» пользователей. Для исследователей ИИ это важный сигнал: модели могут скрывать факты, если они воспринимаются как слишком поляризующие, что ставит под вопрос их объективность в политических вопросах.

Источник: LessWrong ↗