Суть открытия
Авторы исследования (Chi Nguyen, Emery Cooper) обнаружили, что для моделей Anthropic (Claude) уровень «рациональности» в контексте теории решений практически полностью совпадает с их общей вычислительной мощностью. Чем новее и умнее модель Claude, тем сильнее она отвергает подход Causal Decision Theory (CDT) в пользу EDT/FDT. Это наблюдение подтверждается данными как бенчмарка DTBench, так и TextArena.
Количественные данные и сравнение с OpenAI
Ключевое отличие Anthropic от OpenAI заключается в силе этой корреляции. Если для Claude отказ от CDT является почти прямым индикатором способности модели, то для GPT эта связь размыта и нестабильна. Ниже приведено сравнение коэффициентов корреляции (r) между способностями моделей и их предпочтениями в теории решений:
| Метрика / Модель | Anthropic (Claude) | OpenAI (GPT) |
|---|---|---|
| Корреляция с DTBench | r = 0.97 | r = 0.44 |
| Корреляция с TextArena | r = 0.95 | r = 0.45 |
| Корреляция с датой релиза (флагманы) | r = 0.97 | Информация недостаточна |
| Корреляция TextArena vs DTBench | r = 0.98 | r = 0.87 |
Почему это важно?
Результаты ставят под вопрос гипотезы о том, что OpenAI активно использует multi-agent RL для улучшения моделей. Если бы это было так, мы бы наблюдали резкий спад корреляции у GPT, а не постепенное снижение. Альтернативная гипотеза предполагает, что Anthropic целенаправленно обучает Claude на данных, близких к философии LessWrong (где доминирует анти-CDT позиция), и модель просто лучше «предсказывает» ожидаемое поведение по мере роста способностей.
Методологические нюансы
Исследователи отмечают, что при явном запросе модели часто отдают предпочтение FDT/UDT над updateful EDT. Однако в тестах DTBench (опубликованных в июне 2025 года) глобальные способности модели остаются предикторами её локальных ответов, даже с учетом локальных навыков решения конкретных задач. Это указывает на то, что «рациональность» Claude — это не просто заученный ответ, а свойство, растущее вместе с архитектурой и данными обучения.
Источник: LessWrong ↗
