Проблема статичного восприятия
Мультимодальные большие языковые модели (MLLM) демонстрируют впечатляющие результаты в распознавании объектов и сцен, но их способность к социальной интеллигенции остается слабой. Существующие тесты часто ограничиваются анализом статичного текста или отдельных кадров, игнорируя кумулятивный характер поведения. Реальная мотивация человека меняется со временем, и модели пока не умеют удерживать эту динамику в контексте.
Что такое MultivationBench
Команда исследователей во главе с Kawai Chung представила MultivationBench — специализированный бенчмарк, построенный на психологических фреймворках: иерархии потребностей Маслоу и базовых желаниях Райсса. Задача моделей заключается не просто в описании кадра, а в интеграции накопленного мультимодального контекста для вывода эволюционирующих мотивов персонажей в сюжетных визуальных нарративах.
Ключевые метрики и результаты
Тестирование показало критический разрыв между способностью к статичному распознаванию и динамическому рассуждению. Все протестированные модели продемонстрировали низкую стабильность в отслеживании мотивов на протяжении последовательных сцен. Это указывает на то, что современные MLLM не способны формировать целостную «историю» намерений персонажа, теряя нить повествования при переходе от одного события к другому.
| Аспект оценки | Описание | Результат MLLM |
|---|---|---|
| Статичное распознавание | Анализ одного кадра/текста | Высокая точность |
| Последовательное рассуждение | Отслеживание мотивов в серии кадров | Низкая стабильность |
| Психологическая база | Маслоу / Райсс | Сложность интеграции |
Почему это важно
Результаты MultivationBench выявляют фундаментальное ограничение текущих архитектур: отсутствие долгосрочной памяти о социальных состояниях. Для создания по-настоящему социальных AI-агентов, способных вести диалог или работать в команде, необходимо решить проблему сохранения контекста мотивации. Исследование доступно на arXiv (2607.26465), код и данные опубликованы для сообщества.
Источник: arXiv cs.AI ↗
