Проблема «черного ящика» в визуальном мышлении
Современные мультимодальные модели (VLM) часто хвалят за ответы на вопросы по изображениям, но их внутреннее понимание пространственной геометрии остается загадкой. Стандартные бенчмарки смешивают распознавание текста, знание фактов и логику, скрывая истинные способности модели к реконструкции 3D-структуры. Исследовательница Мичеллин Лин (Michelle Lin) создала StateSight — процедурно сгенерированный набор данных, который изолирует именно этот навык: способность «увидеть» то, что скрыто от взгляда.
Три задачи и жесткие метрики
StateSight состоит из трех семейств задач, каждая из которых содержит 300 промптов с детерминированными ответами. Оценка проводится по точному совпадению (exact-match). Модели должны были решить задачи на:
- Противоположные грани куба: определение грани, противоположной заданной, на развертке.
- Подсчет башен: подсчет кубов в башне, где часть скрыта за другими.
- Связные компоненты: подсчет групп из 4-связанных пикселей/элементов.
Результаты: люди против SOTA
Самым шокирующим результатом стало то, что даже флагманские модели 2026 года значительно уступают среднему человеку. При этом модели выдавали «форматно правильные» ответы, маскируя провалы в логике. Ниже приведено сравнение точности (Accuracy) на трех типах задач:
| Модель / Группа | Противоположные грани | Подсчет башен | Связные компоненты |
|---|---|---|---|
| OpenAI GPT-5.5 (gpt-5.5) | 59.3% | 33.3% | 28.3% |
| Claude Sonnet 5 | 53.3% | 18.7% | 7.3% |
| Человеческий базис (30 чел., 60 items) | 80.8% | 68.8% | 64.3% |
Обратите внимание на Claude Sonnet 5: его точность в 7.3% на задаче со связными компонентами означает, что модель практически не способна к верифицируемому визуальному выводу в этой конфигурации.
StateSight-Steps: попытка исправить ситуацию
Авторы также представили StateSight-Steps — вспомогательный датасет из 900 примеров с чередованием изображений и текста, а также 3,600 детерминированных промежуточных визуальных состояний. Это позволяет модели «шагать» через процесс реконструкции, а не гадать финальный ответ. Анализ ошибок показал, что основные сбои происходят на этапе реконструкции исходного состояния изображения, а не на этапе логического вывода.
Почему это важно
StateSight доказывает, что наличие валидного формата ответа не гарантирует понимания сути. Для разработчиков автономных агентов и систем робототехники это критический сигнал: текущие VLM не могут надежно оперировать скрытыми 3D-объектами без явного пошагового обучения или внешних инструментов геометрии.
Источник: arXiv cs.AI ↗
