Проблема сравнения: почему бенчмарки не работают
Пока индустрия гонится за результатами в математике и коде, вопрос о том, насколько ответы ИИ похожи на человеческие в повседневных ситуациях, остается открытым. Авторы работы — коллектив из 56 исследователей, включая ученых из MIT, Harvard и Google DeepMind — представляют CogGym. Это масштабируемая платформа, использующая язык разметки экспериментов (EML) для стандартизации задач из когнитивной науки. Цель — не просто проверить точность, а понять, где модели копируют людей, а где систематически ошибаются.
Масштаб исследования: 258 экспериментов и 50 моделей
Для первого релиза команда стандартизировала 258 экспериментов из 100 научных статей, сфокусировавшись на здравом смысле (commonsense reasoning). В тестировании участвовали 50 крупных языковых моделей. Ключевая методология — «человек в контуре» (human-in-the-loop), которая позволяет воспроизводить условия экспериментов с людьми для машин.
Ключевые метрики: разрыв с человеческой надежностью
Самый важный вывод исследования — даже лучшие современные модели значительно уступают людям в согласованности суждений. Для сравнения: надежность человеческого ответа при разделении выборки (split-half reliability) составляет около 0.93–0.95. Лучшие модели достигают лишь половины этого показателя.
| Метрика (R²) | Человеческая надежность (Baseline) | Лучшие AI-модели | Разрыв |
|---|---|---|---|
| Текст | 0.93 | 0.59 | ~36% |
| Изображения | 0.95 | 0.58 | ~39% |
| Видео | 0.92 | 0.43 | ~53% |
Тренд масштабирования: медленнее, чем в STEM
Авторы подтверждают наличие тренда масштабирования: более новые и крупные модели лучше воспроизводят человеческие суждения. Однако этот прогресс значительно медленнее, чем рост производительности в формальных задачах (математика, программирование). Улучшение в области здравого смысла идет медленнее, что указывает на фундаментальные различия в том, как модели учатся логике, а как — интуиции.
Значение для индустрии
CogGym позиционируется как «живая» платформа. В отличие от статических бенчмарков, она будет постоянно пополняться новыми экспериментами из когнитивной науки. Это позволяет отслеживать эволюцию ИИ не только в способности решать задачи, но и в способности думать так, как это делают люди. Для разработчиков это сигнал: оптимизация под формальные метрики больше не гарантирует адекватности в реальных сценариях.
Источник: arXiv cs.AI ↗
