Исследования9 июля 2026 г., 12:18 МСК🤖 Auto

ИИ не понимает физику света: новый бенчмарк ImagingBench

Исследователи представили ImagingBench — первый систематический тест, доказывающий, что современные VLM и агентные модели (Gemini, GPT, Qwen) не справляются с физическими задачами вычислительной оптики.

Баннер новости 3194

Разрыв между семантикой и физикой

В то время как Vision-Language Models (VLM) демонстрируют выдающиеся результаты в понимании семантики изображений, их способность решать задачи, основанные на физике и обратных задачах, остается неясной. Авторы работы из arXiv (2607.07189) представили ImagingBench — бенчмарк, состоящий из 20 задач вычислительной оптики. Цель исследования — измерить разрыв между визуальной компетентностью моделей и их способностью работать с физически обоснованными данными.

Структура тестирования: три режима

Для оценки способностей моделей использовались три互补 (взаимодополняющих) сценария, охватывающих пять ключевых категорий: лучевая и волновая оптика, обработка сигналов, обратная реконструкция, вычислительное зондирование и калибровка.

Режим оценки Описание метода Цель теста
Expert Фиксированное экспертное руководство Проверка базовой способности к обратной реконструкции по заданному шаблону.
Planner Планирование на основе агента Оценка способности модели самостоятельно выстраивать цепочку действий для решения задачи.
Forward Прямое моделирование системы Проверка согласованности выходных данных с физической моделью системы.

Результаты: агенты уступают специализированным методам

В исследовании сравнивались проприетарные и открытые модели, включая Google Gemini, OpenAI GPT и Alibaba Qwen, с репрезентативными неагентными специализированными базовыми методами. Результаты показали устойчивое отставание агентных ИИ:

  • Слабые стороны: Наибольшие проблемы возникли в задачах вычислительного зондирования, таких как безлинзовая съемка (lensless imaging), реконструкция на основе событий (event-based), времяпролетная съемка (time-of-flight) и голография.
  • Эффект планирования: Использование режима Planner дало лишь незначительное и нестабильное улучшение по сравнению с фиксированным промптом Expert.
  • Визуальная правдоподобность vs. точность: Модели часто генерируют визуально правдоподобные результаты, но их точность (fidelity) при сравнении с эталонными данными остается низкой.

Почему это важно

Результаты ImagingBench выявляют существенный пробел: способность ИИ «понимать» картинку семантически не означает, что он понимает физику процесса её создания. Для таких областей, как медицинская визуализация, астрономия и робототехника, где критична физическая точность реконструкции, текущие VLM-подходы недостаточны. ImagingBench становится первым унифицированным полигоном для измерения этого разрыва и отслеживания прогресса в области агентного ИИ для вычислительной оптики.

Источник: arXiv cs.AI ↗