Прорыв в долгосрочном трекинге
Команда исследователей из Университета Карнеги-Меллона (CMU) и Meta представила метод TrackEverything, описанный в статье «TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations» (авторы: Ayush Jain, Sreeharsha Paruchuri и др., 2026 год). Главная особенность системы — способность выполнять плотный трекинг (dense tracking) на полном протяжении видео, содержащего более 1000 кадров, без потери точности.
В отличие от традиционных подходов, которые часто ограничиваются отслеживанием точек, видимых с первого кадра, TrackEverything начинает отслеживание объекта сразу же, как только он появляется в кадре. Это достигается за счет механизма «де-дубликации» 3D-представлений сцены, что позволяет эффективно обрабатывать динамические изменения окружения.
Ключевые технические детали
- Длительность: Поддержка последовательностей длиной 1000+ кадров.
- Классификация: Алгоритм разделяет траектории на статические (синие точки) и динамические (красные точки) на уровне каждого окна, что позволяет точно декодировать движения.
- 3D-реконструкция: Метод генерирует плотные 3D-траектории, рендеримые в исходной проекции камеры.
Сравнение с базовыми моделями
Качественное сравнение показывает существенное преимущество TrackEverything перед существующими методами, такими как DELTA-v2, CoTracker3 и SpatialTracker-v2. Основные конкуренты часто «залипают» на объектах, видимых в начале видео, или теряют их при появлении новых. TrackEverything демонстрирует устойчивость к новым объектам.
| Метод | Начало трекинга | Работа с новыми объектами | Тип трекинга |
|---|---|---|---|
| DELTA-v2 | С первого кадра | Ограниченная | Точечный/Средний |
| CoTracker3 | С первого кадра | Ограниченная | Точечный |
| SpatialTracker-v2 | С первого кадра | Ограниченная | Пространственный |
| TrackEverything (Ours) | С момента появления | Высокая | Плотный 3D |
Ограничения и области применения
Авторы отмечают, что производительность метода снижается при быстром движении с большими смещениями (large-displacement motion), а также на фонах с повторяющимся паттерном или низкой текстурой. В таких случаях 3D-соответствия становятся неоднозначными, что приводит к деградации качества трекинга.
Тем не менее, метод открывает новые возможности для анализа видео, робототехники и дополненной реальности, где критически важно понимать полную динамику сцены, а не только статичные элементы.
Доступность
Код и материалы исследования доступны на GitHub-странице проекта. Статья опубликована в arXiv (eprint: 2609.30222) в разделе Computer Vision и Graphics.
Источник: Github ↗
