Проблема статичности
Современные мультимодальные модели (LMM) демонстрируют выдающиеся результаты в распознавании статичных изображений и аудио. Однако их способность к абстрактному перцептивному рассуждению — умению выводить скрытую информацию из динамических, генеративных процессов — остается слабой зоной. Исследователи из arXiv (preprint 2608.14558) представили The Unwritten Benchmark, чтобы протестировать именно этот когнитивный навык.
Суть задачи: акусо-кинематический вывод
Ключевая задача бенчмарка — acousto-kinematic word inference. Модели должны не просто «увидеть» или «услышать» результат, а реконструировать слово, анализируя процесс его создания. Тест включает 3 различных стиля письма, где модель должна связать кинематику движения (как чертится буква) и акустику (звук инструмента/пера) с итоговым текстом.
Почему это важно
Это смещает фокус с распознавания образов на понимание процесса. Если модель может только классифицировать готовое изображение, она не обладает истинным пониманием контекста создания. The Unwritten Benchmark требует от AI способности к абстрактному мышлению, аналогичному человеческому восприятию рукописного текста или музыкального исполнения в реальном времени.
Ключевые метрики и детали
Бенчмарк оценивает способность модели к инференсу (выводу) ненаблюдаемой информации. Успешное прохождение теста требует интеграции визуальных и аудиальных данных в единый временной контекст, что является новым вызовом для архитектуры современных LMM.
Источник: arXiv cs.AI ↗
