Исследования18 августа 2026 г., 05:17 МСК🤖 Auto

Claude и CDT: корреляция способностей с отказом от теории решений

Исследование LessWrong выявило почти идеальную корреляцию (r=0.97) между интеллектуальными способностями моделей Anthropic и их неприятием теории решений CDT. Для GPT эта связь значительно слабее.

Баннер новости 5964

Суть открытия

Авторы исследования (Chi Nguyen, Emery Cooper) обнаружили, что для моделей Anthropic (Claude) уровень «рациональности» в контексте теории решений практически полностью совпадает с их общей вычислительной мощностью. Чем новее и умнее модель Claude, тем сильнее она отвергает подход Causal Decision Theory (CDT) в пользу EDT/FDT. Это наблюдение подтверждается данными как бенчмарка DTBench, так и TextArena.

Количественные данные и сравнение с OpenAI

Ключевое отличие Anthropic от OpenAI заключается в силе этой корреляции. Если для Claude отказ от CDT является почти прямым индикатором способности модели, то для GPT эта связь размыта и нестабильна. Ниже приведено сравнение коэффициентов корреляции (r) между способностями моделей и их предпочтениями в теории решений:

Метрика / Модель Anthropic (Claude) OpenAI (GPT)
Корреляция с DTBench r = 0.97 r = 0.44
Корреляция с TextArena r = 0.95 r = 0.45
Корреляция с датой релиза (флагманы) r = 0.97 Информация недостаточна
Корреляция TextArena vs DTBench r = 0.98 r = 0.87

Почему это важно?

Результаты ставят под вопрос гипотезы о том, что OpenAI активно использует multi-agent RL для улучшения моделей. Если бы это было так, мы бы наблюдали резкий спад корреляции у GPT, а не постепенное снижение. Альтернативная гипотеза предполагает, что Anthropic целенаправленно обучает Claude на данных, близких к философии LessWrong (где доминирует анти-CDT позиция), и модель просто лучше «предсказывает» ожидаемое поведение по мере роста способностей.

Методологические нюансы

Исследователи отмечают, что при явном запросе модели часто отдают предпочтение FDT/UDT над updateful EDT. Однако в тестах DTBench (опубликованных в июне 2025 года) глобальные способности модели остаются предикторами её локальных ответов, даже с учетом локальных навыков решения конкретных задач. Это указывает на то, что «рациональность» Claude — это не просто заученный ответ, а свойство, растущее вместе с архитектурой и данными обучения.

Источник: LessWrong ↗