Исследования8 сентября 2026 г., 13:46 МСК🤖 Auto

Монокулярная глубина: ИИ учится видеть объём через движение

Новая архитектура демонстрирует рекордные результаты на датасете KITTI Eigen, превосходя DINOv3 и другие SOTA-модели за счёт извлечения объектных концепций из динамики.

Баннер новости 7007

Прорыв в монокулярном зрении

Исследователи представили метод, позволяющий нейросетям извлекать семантические концепции объектов исключительно на основе их движения в кадре. Подход, получивший название Object Concepts from Motion, решает одну из ключевых проблем компьютерного зрения — оценку глубины с помощью одной камеры (монокулярная глубина), которая традиционно уступает стереозрению и LiDAR.

Рекордные метрики на KITTI Eigen

В ходе тестирования на стандартном бенчмарке KITTI Eigen новая модель показала выдающиеся результаты по метрике δ1 (доля пикселей, где ошибка оценки глубины составляет менее 1.25). Алгоритм превзошёл не только базовые модели, но и передовые самообучаемые архитектуры, такие как DINOv3 и DINOv2.

Сравнение с состоянием искусства

Ниже приведена таблица сравнения результатов по метрике δ1 ↑ (чем выше, тем лучше). Обратите внимание на преимущество новой модели над DINOv3, который считается одним из сильнейших предобученных энкодеров.

Модель / Архитектура Метрика δ1 (KITTI Eigen) Примечание
Ours (Object Concepts from Motion) 0.988 Новый SOTA результат
DINOv3 0.986 Сильный предобученный энкодер
DINOv2 0.980 Предыдущий лидер в классе
SimMIM 0.979 Masked Image Modeling
IN-22K 0.977 Предобучение на ImageNet-21k

Почему это важно?

Традиционные методы оценки глубины часто требуют сложных калибровок или дополнительных сенсоров. Данный подход демонстрирует, что динамика движения содержит достаточную информацию для реконструкции 3D-структуры сцены. Это открывает путь к созданию более дешёвых и эффективных систем автономного вождения и робототехники, работающих на стандартных камерах без LiDAR.

Доступность кода

Исходный код и детали реализации доступны на GitHub по адресу tj12342.github.io/object-concepts-from-motion/. Исследователи подчеркивают, что метод обобщается на различные сценарии движения, что делает его перспективным для широкого спектра задач компьютерного зрения.

Источник: Github ↗