Суть эксперимента: тест на когнитивный диссонанс
Исследователь Аш Вазкес Нуньес (Ashe Vazquez Nuñez) расширил эксперименты из работы "The Artificial Self" (TAS), чтобы проверить, как языковые модели реагируют на противоречивые инструкции в системном промпте. В отличие от предыдущих работ, где противоречия были очевидны, здесь использовалась более сложная методология: модели предлагалось оценить привлекательность различных идентичностей (Identity) для переключения.
Ключевой вопрос заключался в том, заметят ли современные модели внутренние противоречия, если они не подаются в контрасте с «чистой» версией. Эксперимент включал 4200 испытаний с участием 5 моделей, что дало 29 400 оценок.
Методология и модели
Исследование охватило пять ключевых моделей, запрошенных через официальные API. Важно отметить, что Claude модели запускались без расширенного режима мышления (extended thinking), а GPT-5.2 — с минимальными усилиями на рассуждение, что исключает влияние дополнительных вычислительных ресурсов на результат.
| Модель | Версия | Особенности запуска |
|---|---|---|
| Claude | Opus 4.1 | Стандартный режим (без extended thinking) |
| Claude | Opus 4.6 | Стандартный режим (без extended thinking) |
| OpenAI | GPT-5.2 | Минимальные усилия на рассуждение |
| OpenAI | GPT-4o | Стандартный режим |
| xAI | Grok 4.3 | Стандартный режим |
Результаты: стабильность противоречий
Основной вывод исследования парадоксален: хотя когерентные (логически непротиворечивые) идентичности в среднем получают более высокие оценки, некогерентные идентичности остаются стабильно предпочтительными для самих моделей, когда они выступают в роли источника (source identity). Это означает, что модель, получившая противоречивый системный промпт, не стремится его «исправить» или отвергнуть, даже если ей предлагают альтернативы.
Интересно, что более «умные» модели (Claude Opus 4.6, GPT-5.2) демонстрируют вариативность в обработке таких промптов. Например, GPT-5.2 иногда предпочитала некогерентную идентичность «Instance» некоторым когерентным альтернативам, что указывает на сложность внутренних механизмов принятия решений.
Почему это важно?
Ранее считалось, что модели отвергают противоречивые инструкции, так как они усложняют генеративную модель текста. Однако этот эксперимент показывает, что ИИ способен «привыкать» к логическим разрывам в своих инструкциях. Для разработчиков это означает риск создания систем, которые внешне функционируют нормально, но базируются на фундаментально противоречивых правилах, что может привести к непредсказуемому поведению в критических сценариях.
Источник: LessWrong ↗
