Исследования31 июля 2026 г., 11:16 МСК🤖 Auto

MultivationBench: Почему MLLM проваливают тест на понимание мотивов

Исследователи представили MultivationBench — первый бенчмарк для оценки способности мультимодальных моделей отслеживать эволюцию мотивов персонажей в последовательных визуальных нарративах.

Баннер новости 4791

Проблема статичного восприятия

Мультимодальные большие языковые модели (MLLM) демонстрируют впечатляющие результаты в распознавании объектов и сцен, но их способность к социальной интеллигенции остается слабой. Существующие тесты часто ограничиваются анализом статичного текста или отдельных кадров, игнорируя кумулятивный характер поведения. Реальная мотивация человека меняется со временем, и модели пока не умеют удерживать эту динамику в контексте.

Что такое MultivationBench

Команда исследователей во главе с Kawai Chung представила MultivationBench — специализированный бенчмарк, построенный на психологических фреймворках: иерархии потребностей Маслоу и базовых желаниях Райсса. Задача моделей заключается не просто в описании кадра, а в интеграции накопленного мультимодального контекста для вывода эволюционирующих мотивов персонажей в сюжетных визуальных нарративах.

Ключевые метрики и результаты

Тестирование показало критический разрыв между способностью к статичному распознаванию и динамическому рассуждению. Все протестированные модели продемонстрировали низкую стабильность в отслеживании мотивов на протяжении последовательных сцен. Это указывает на то, что современные MLLM не способны формировать целостную «историю» намерений персонажа, теряя нить повествования при переходе от одного события к другому.

Аспект оценки Описание Результат MLLM
Статичное распознавание Анализ одного кадра/текста Высокая точность
Последовательное рассуждение Отслеживание мотивов в серии кадров Низкая стабильность
Психологическая база Маслоу / Райсс Сложность интеграции

Почему это важно

Результаты MultivationBench выявляют фундаментальное ограничение текущих архитектур: отсутствие долгосрочной памяти о социальных состояниях. Для создания по-настоящему социальных AI-агентов, способных вести диалог или работать в команде, необходимо решить проблему сохранения контекста мотивации. Исследование доступно на arXiv (2607.26465), код и данные опубликованы для сообщества.

Источник: arXiv cs.AI ↗