Исследования21 сентября 2026 г., 12:18 МСК🤖 Auto

CogGym: ИИ отстает от людей в здравом смысле, но масштабируется

Исследователи представили платформу CogGym, сравнившую 50 LLM с людьми на 258 когнитивных тестах. Модели учатся, но их «здравый смысл» все еще далек от человеческого уровня.

Баннер новости 7936

Проблема сравнения: почему бенчмарки не работают

Пока индустрия гонится за результатами в математике и коде, вопрос о том, насколько ответы ИИ похожи на человеческие в повседневных ситуациях, остается открытым. Авторы работы — коллектив из 56 исследователей, включая ученых из MIT, Harvard и Google DeepMind — представляют CogGym. Это масштабируемая платформа, использующая язык разметки экспериментов (EML) для стандартизации задач из когнитивной науки. Цель — не просто проверить точность, а понять, где модели копируют людей, а где систематически ошибаются.

Масштаб исследования: 258 экспериментов и 50 моделей

Для первого релиза команда стандартизировала 258 экспериментов из 100 научных статей, сфокусировавшись на здравом смысле (commonsense reasoning). В тестировании участвовали 50 крупных языковых моделей. Ключевая методология — «человек в контуре» (human-in-the-loop), которая позволяет воспроизводить условия экспериментов с людьми для машин.

Ключевые метрики: разрыв с человеческой надежностью

Самый важный вывод исследования — даже лучшие современные модели значительно уступают людям в согласованности суждений. Для сравнения: надежность человеческого ответа при разделении выборки (split-half reliability) составляет около 0.93–0.95. Лучшие модели достигают лишь половины этого показателя.

Метрика (R²) Человеческая надежность (Baseline) Лучшие AI-модели Разрыв
Текст 0.93 0.59 ~36%
Изображения 0.95 0.58 ~39%
Видео 0.92 0.43 ~53%

Тренд масштабирования: медленнее, чем в STEM

Авторы подтверждают наличие тренда масштабирования: более новые и крупные модели лучше воспроизводят человеческие суждения. Однако этот прогресс значительно медленнее, чем рост производительности в формальных задачах (математика, программирование). Улучшение в области здравого смысла идет медленнее, что указывает на фундаментальные различия в том, как модели учатся логике, а как — интуиции.

Значение для индустрии

CogGym позиционируется как «живая» платформа. В отличие от статических бенчмарков, она будет постоянно пополняться новыми экспериментами из когнитивной науки. Это позволяет отслеживать эволюцию ИИ не только в способности решать задачи, но и в способности думать так, как это делают люди. Для разработчиков это сигнал: оптимизация под формальные метрики больше не гарантирует адекватности в реальных сценариях.

Источник: arXiv cs.AI ↗