Исследования24 августа 2026 г., 10:17 МСК🤖 Auto

StateSight: VLM не видят структуру. GPT-5.5 и Claude Sonnet 5 провалили тест на пространственное мышление

Исследование Michelle Lin представило StateSight — бенчмарк, изолирующий способность моделей к реконструкции скрытой 3D-структуры. GPT-5.5 и Claude Sonnet 5 показали низкие результаты, уступив даже людям.

Баннер новости 6367

Проблема «черного ящика» в визуальном мышлении

Современные мультимодальные модели (VLM) часто хвалят за ответы на вопросы по изображениям, но их внутреннее понимание пространственной геометрии остается загадкой. Стандартные бенчмарки смешивают распознавание текста, знание фактов и логику, скрывая истинные способности модели к реконструкции 3D-структуры. Исследовательница Мичеллин Лин (Michelle Lin) создала StateSight — процедурно сгенерированный набор данных, который изолирует именно этот навык: способность «увидеть» то, что скрыто от взгляда.

Три задачи и жесткие метрики

StateSight состоит из трех семейств задач, каждая из которых содержит 300 промптов с детерминированными ответами. Оценка проводится по точному совпадению (exact-match). Модели должны были решить задачи на:

  • Противоположные грани куба: определение грани, противоположной заданной, на развертке.
  • Подсчет башен: подсчет кубов в башне, где часть скрыта за другими.
  • Связные компоненты: подсчет групп из 4-связанных пикселей/элементов.

Результаты: люди против SOTA

Самым шокирующим результатом стало то, что даже флагманские модели 2026 года значительно уступают среднему человеку. При этом модели выдавали «форматно правильные» ответы, маскируя провалы в логике. Ниже приведено сравнение точности (Accuracy) на трех типах задач:

Модель / Группа Противоположные грани Подсчет башен Связные компоненты
OpenAI GPT-5.5 (gpt-5.5) 59.3% 33.3% 28.3%
Claude Sonnet 5 53.3% 18.7% 7.3%
Человеческий базис (30 чел., 60 items) 80.8% 68.8% 64.3%

Обратите внимание на Claude Sonnet 5: его точность в 7.3% на задаче со связными компонентами означает, что модель практически не способна к верифицируемому визуальному выводу в этой конфигурации.

StateSight-Steps: попытка исправить ситуацию

Авторы также представили StateSight-Steps — вспомогательный датасет из 900 примеров с чередованием изображений и текста, а также 3,600 детерминированных промежуточных визуальных состояний. Это позволяет модели «шагать» через процесс реконструкции, а не гадать финальный ответ. Анализ ошибок показал, что основные сбои происходят на этапе реконструкции исходного состояния изображения, а не на этапе логического вывода.

Почему это важно

StateSight доказывает, что наличие валидного формата ответа не гарантирует понимания сути. Для разработчиков автономных агентов и систем робототехники это критический сигнал: текущие VLM не могут надежно оперировать скрытыми 3D-объектами без явного пошагового обучения или внешних инструментов геометрии.

Источник: arXiv cs.AI ↗