Исследования18 августа 2026 г., 07:18 МСК🤖 Auto

The Unwritten Benchmark: AI провалил тест на абстрактное восприятие

Новый бенчмарк The Unwritten Benchmark выявил критический пробел в мультимодальных моделях: они не умеют выводить смысл из динамических процессов, таких как процесс рисования или звучания.

Баннер новости 5966

Проблема статичности

Современные мультимодальные модели (LMM) демонстрируют выдающиеся результаты в распознавании статичных изображений и аудио. Однако их способность к абстрактному перцептивному рассуждению — умению выводить скрытую информацию из динамических, генеративных процессов — остается слабой зоной. Исследователи из arXiv (preprint 2608.14558) представили The Unwritten Benchmark, чтобы протестировать именно этот когнитивный навык.

Суть задачи: акусо-кинематический вывод

Ключевая задача бенчмарка — acousto-kinematic word inference. Модели должны не просто «увидеть» или «услышать» результат, а реконструировать слово, анализируя процесс его создания. Тест включает 3 различных стиля письма, где модель должна связать кинематику движения (как чертится буква) и акустику (звук инструмента/пера) с итоговым текстом.

Почему это важно

Это смещает фокус с распознавания образов на понимание процесса. Если модель может только классифицировать готовое изображение, она не обладает истинным пониманием контекста создания. The Unwritten Benchmark требует от AI способности к абстрактному мышлению, аналогичному человеческому восприятию рукописного текста или музыкального исполнения в реальном времени.

Ключевые метрики и детали

Бенчмарк оценивает способность модели к инференсу (выводу) ненаблюдаемой информации. Успешное прохождение теста требует интеграции визуальных и аудиальных данных в единый временной контекст, что является новым вызовом для архитектуры современных LMM.

Источник: arXiv cs.AI ↗