Прорыв в монокулярном зрении
Исследователи представили метод, позволяющий нейросетям извлекать семантические концепции объектов исключительно на основе их движения в кадре. Подход, получивший название Object Concepts from Motion, решает одну из ключевых проблем компьютерного зрения — оценку глубины с помощью одной камеры (монокулярная глубина), которая традиционно уступает стереозрению и LiDAR.
Рекордные метрики на KITTI Eigen
В ходе тестирования на стандартном бенчмарке KITTI Eigen новая модель показала выдающиеся результаты по метрике δ1 (доля пикселей, где ошибка оценки глубины составляет менее 1.25). Алгоритм превзошёл не только базовые модели, но и передовые самообучаемые архитектуры, такие как DINOv3 и DINOv2.
Сравнение с состоянием искусства
Ниже приведена таблица сравнения результатов по метрике δ1 ↑ (чем выше, тем лучше). Обратите внимание на преимущество новой модели над DINOv3, который считается одним из сильнейших предобученных энкодеров.
| Модель / Архитектура | Метрика δ1 (KITTI Eigen) | Примечание |
|---|---|---|
| Ours (Object Concepts from Motion) | 0.988 | Новый SOTA результат |
| DINOv3 | 0.986 | Сильный предобученный энкодер |
| DINOv2 | 0.980 | Предыдущий лидер в классе |
| SimMIM | 0.979 | Masked Image Modeling |
| IN-22K | 0.977 | Предобучение на ImageNet-21k |
Почему это важно?
Традиционные методы оценки глубины часто требуют сложных калибровок или дополнительных сенсоров. Данный подход демонстрирует, что динамика движения содержит достаточную информацию для реконструкции 3D-структуры сцены. Это открывает путь к созданию более дешёвых и эффективных систем автономного вождения и робототехники, работающих на стандартных камерах без LiDAR.
Доступность кода
Исходный код и детали реализации доступны на GitHub по адресу tj12342.github.io/object-concepts-from-motion/. Исследователи подчеркивают, что метод обобщается на различные сценарии движения, что делает его перспективным для широкого спектра задач компьютерного зрения.
Источник: Github ↗
