От пикселя к 6-DoF: новый подход к трекингу
Исследователи из Google Research и Университета Торонто представили ProxyPose — метод одноканального (monocular) трекинга позы объекта в 6 степенях свободы (6-DoF). Ключевая инновация заключается в отказе от прямой геометрической оптимизации в пользу генеративного ИИ. Метод работает по принципу «one point in, one trajectory out»: на вход подается видео и один пиксель-запрос, а на выходе получается траектория позы.
Алгоритм не пытается сразу вычислить координаты объекта. Вместо этого он использует видео-генеративную модель для создания «прокси-видео», где запрашиваемая точка заменяется цветным кубом, совершающим жесткое движение. Затем к этому сгенерированному видео применяется классический алгоритм Perspective-n-Point (PnP) для восстановления точной 6-DoF позы.
Архитектура: VAE, LoRA и генерация
ProxyPose интегрируется в существующие видео-генераторы через дообучение. Процесс включает следующие этапы:
- Кодирование: Исходное видео и запрос пользователя кодируются в латентное пространство вариационного автоэнкодера (VAE).
- Условная генерация: Токены первого кадра «прокси» получают сниженный шум для сохранения структуры, а последующие кадры — полный гауссов шум. Токены исходного видео остаются без шума.
- LoRA-дообучение: Поток токенов обрабатывается видео-моделью с дообученными через LoRA слоями, что обеспечивает временную согласованность сгенерированного прокси-видео.
- Геометрическая оптимизация: Сгенерированный куб отслеживается методами без обучения (contour fitting + PnP), что дает итоговую позу.
Результаты: Превосходство в сложных условиях
Главное преимущество ProxyPose — устойчивость к материалам, которые традиционно ломают геометрические методы: прозрачность, отражения и сильное перекрытие (occlusion). На синтетических и реальных датасетах (HO3D, YCBInEOAT) метод показывает state-of-the-art результаты даже без использования ограничений жесткости объекта или bundle adjustment.
| Метод | Сложные материалы (прозрачность/отражения) | Сильное перекрытие (Occlusion) | Требует жесткости объекта |
|---|---|---|---|
| ProxyPose | Высокая устойчивость | Высокая устойчивость | Нет (работает с одним пикселем) |
| CoTracker+DAV3 | Низкая (теряет объект) | Средняя | Нет |
| BundleSDF | Низкая (проблемы с рендерингом) | Низкая | Да (для стабильности) |
Расширение возможностей: Лица и новые сенсоры
Несмотря на то, что модель обучалась только на жестких объектах, ProxyPose успешно справляется с трекингом нежестких поверхностей, таких как человеческое лицо, превосходя специализированные методы вроде FlowFace. Кроме того, метод не требует дообучения для работы с альтернативными модальностями:
- Event-based video: Трекинг вращающегося спиннера с помощью камеры событий.
- Single-photon imaging: Трекинг игрушечного оружия с использованием SPAD-матрицы.
Ограничения и перспективы
Метод наследует ограничения базовой видео-модели. Наблюдается дрейф позы на зеркальных поверхностях при сложном движении (например, воздушные шары) и размытие кадров при очень быстром движении, что ухудшает контурный анализ. Также метод не применим к областям с неопределенным движением, таким как поверхность жидкости. Тем не менее, ProxyPose открывает путь к надежному трекингу в сценариях, где традиционные методы (включая COLMAP) терпят неудачу из-за нехватки текстуры.
Источник: Github ↗
