Проблема: «Успех» не означает компетентность
Оценка роботизированных агентов (embodied agents) традиционно опирается на два подхода: ручное аннотирование пар Visual Question Answering (VQA) или метрики завершения высокоуровневых задач. Первый метод трудоемок и субъективен, второй — маскирует уязвимости. Агент может выполнить навигацию, нарушая правила безопасности или используя неоптимальные пути, что скрывает реальные риски.
Проблема усугубляется тем, что пространственное познание (spatial cognition) является фундаментом для любых физических взаимодействий, но его качество остается «черным ящиком».
Решение: MetaSpace и метаморфическое тестирование
Команда авторов (Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang) предложила фреймворк MetaSpace, вдохновленный принципами метаморфического тестирования из инженерии ПО. Вместо проверки абсолютной правильности ответа, система проверяет логическую согласованность состояний агента во времени.
Ключевые особенности метода:
- Автоматическая генерация тестов: На основе реальных траекторий выполнения задач.
- Логические правила: Мета-отношения (Metamorphic Relations, MRs) закодированы на языке логического программирования Prolog.
- Физические законы: Тесты базируются на незыблемых правилах физики и логики пространства.
Нарушение этих отношений сигнализирует о сбое в пространственном понимании, даже если внешняя задача была формально выполнена.
Результаты: Разрыв между AI и человеком
Эмпирическая оценка проводилась в трех сценариях с участием современных SOTA-агентов на базе мультимодальных LLM. Результаты оказались шокирующими:
| Метрика / Показатель | Значение | Комментарий |
|---|---|---|
| Выявленные ошибки | 90 422 | Количество нарушений пространственной логики у SOTA-агентов |
| Средний SC-скор (AI) | 0.44 – 0.52 | Показатель пространственного познания лучших моделей |
| Человеческий бенчмарк | 0.96 | Эталонный результат для сравнения |
| Публикация | OOPSLA 2026 | Proceedings of the ACM on Programming Languages |
Средний балл по шкале Spatial Cognition (SC) у лучших моделей составил лишь 0.44–0.52, что вдвое ниже человеческого показателя (0.96). Это доказывает, что текущие SOTA-модели обладают поверхностным пониманием пространства, достаточным для простых задач, но не для надежного физического взаимодействия.
Почему это важно
MetaSpace демонстрирует, что текущий прогресс в VQA и навигации не означает глубокого понимания мира. Для разработчиков автономных систем это сигнал к необходимости внедрения новых стандартов валидации, основанных на логических инвариантах, а не только на метриках успеха задач.
Источник: arXiv cs.AI ↗
