Разрыв между семантикой и физикой
В то время как Vision-Language Models (VLM) демонстрируют выдающиеся результаты в понимании семантики изображений, их способность решать задачи, основанные на физике и обратных задачах, остается неясной. Авторы работы из arXiv (2607.07189) представили ImagingBench — бенчмарк, состоящий из 20 задач вычислительной оптики. Цель исследования — измерить разрыв между визуальной компетентностью моделей и их способностью работать с физически обоснованными данными.
Структура тестирования: три режима
Для оценки способностей моделей использовались три互补 (взаимодополняющих) сценария, охватывающих пять ключевых категорий: лучевая и волновая оптика, обработка сигналов, обратная реконструкция, вычислительное зондирование и калибровка.
| Режим оценки | Описание метода | Цель теста |
|---|---|---|
| Expert | Фиксированное экспертное руководство | Проверка базовой способности к обратной реконструкции по заданному шаблону. |
| Planner | Планирование на основе агента | Оценка способности модели самостоятельно выстраивать цепочку действий для решения задачи. |
| Forward | Прямое моделирование системы | Проверка согласованности выходных данных с физической моделью системы. |
Результаты: агенты уступают специализированным методам
В исследовании сравнивались проприетарные и открытые модели, включая Google Gemini, OpenAI GPT и Alibaba Qwen, с репрезентативными неагентными специализированными базовыми методами. Результаты показали устойчивое отставание агентных ИИ:
- Слабые стороны: Наибольшие проблемы возникли в задачах вычислительного зондирования, таких как безлинзовая съемка (lensless imaging), реконструкция на основе событий (event-based), времяпролетная съемка (time-of-flight) и голография.
- Эффект планирования: Использование режима Planner дало лишь незначительное и нестабильное улучшение по сравнению с фиксированным промптом Expert.
- Визуальная правдоподобность vs. точность: Модели часто генерируют визуально правдоподобные результаты, но их точность (fidelity) при сравнении с эталонными данными остается низкой.
Почему это важно
Результаты ImagingBench выявляют существенный пробел: способность ИИ «понимать» картинку семантически не означает, что он понимает физику процесса её создания. Для таких областей, как медицинская визуализация, астрономия и робототехника, где критична физическая точность реконструкции, текущие VLM-подходы недостаточны. ImagingBench становится первым унифицированным полигоном для измерения этого разрыва и отслеживания прогресса в области агентного ИИ для вычислительной оптики.
Источник: arXiv cs.AI ↗
