Исследования5 августа 2026 г., 04:17 МСК🤖 Auto

Фронтальные VLM не обладают единым «теорией разума»

Исследование показало, что передовые зрительно-языковые модели демонстрируют полярно разные результаты в задачах на понимание перспектив и намерений, не формируя целостного профиля.

Баннер новости 5093

Суть проблемы: фрагментация способностей

Новое исследование, опубликованное в arXiv (2608.00261), ставит под сомнение наличие у современных VLM (Vision-Language Models) связной «Теории разума» (Theory of Mind, ToM). Авторы проверили панель из 9 передовых моделей на двух психологических бенчмарках, требующих разных когнитивных навыков: визуального восприятия перспективы и атрибуции намерений.

Ключевой вывод: ни одна модель не показала взрослый уровень понимания на обоих тестах одновременно. Способности моделей фрагментированы: те, что успешны в одной задаче, проваливаются в другой.

Результаты по задачам

Исследование использовало два специфических теста, заимствованных из психологии развития:

  • Keysar Director Task: Тест на визуальное восприятие перспективы с эгоцентрическими помехами. Без использования цепочки рассуждений (Chain-of-Thought) модели совершали эгоцентрическую ошибку в 78% случаев, что характерно для поведения детей, а не взрослых людей. Однако включение рассуждений спасло ситуацию для ряда моделей.
  • Frith-Happé Animated Triangles (по рубрике Castelli): Тест на атрибуцию намерений на основе чистого движения. Здесь модели систематически недооценивали намерения. Их профиль ToM оказался более чем в 3 раза ближе к среднему показанию взрослых с высоким уровнем аутизма (HF-ASD), чем к показателям типично развивающихся взрослых (TD).

Сравнительная таблица профилей ToM

Ниже приведена сводка по поведению моделей на двух задачах. Обратите внимание на обратную корреляцию: модель, ведущая себя «взросло» в одной задаче, ведет себя «по-детски» или «по-аутистично» в другой.

Задача Референсная группа (человек) Поведение панели VLM Ключевая метрика/наблюдение
Keysar Director Task Typical Development (TD) Adults Child-like (без CoT) 78% эгоцентрических ошибок без рассуждений
Keysar Director Task HF-ASD Adults Рассуждения (CoT) улучшают результат, но профиль не совпадает с TD
Animated Triangles HF-ASD Adults Closest Match Профиль ToM в 3+ раза ближе к HF-ASD, чем к TD
Animated Triangles TD Adults Farthest Match Модели недоатрибутируют намерения (Goal-Directed/Random ближе к TD, но общая панель — нет)

Почему это важно

Результаты демонстрируют cross-task dissociation (разобщенность между задачами). Модель, которая выглядит наиболее «взрослой» (ближе к TD) на Director Task, оказывается на стороне HF-ASD на тесте с треугольниками. И наоборот: самая «типично взрослая» модель на тесте намерений ведет себя как ребенок на тесте перспективы.

Авторы подчеркивают, что это групповое описание, а не диагностический ярлык для конкретных моделей. Однако факт остается фактом: современные VLM не обладают единым, когерентным профилем социального интеллекта, соответствующим человеческому. Они имитируют отдельные аспекты ToM, но не интегрируют их в целостную картину.

Источник: arXiv cs.CL ↗