Проблема существующих подходов
Традиционные методы оценки 3D-геометрии по одному изображению (monocular geometry estimation) делятся на два лагеря, каждый из которых жертвует детализацией:
- Детерминированная регрессия (например, MoGe-2): Сеть предсказывает «среднее» значение. При неоднозначности сцены модель размывает тонкие структуры (например, спицы стула) и прозрачные объекты, усредняя возможные варианты.
- Латентная диффузия (например, GeometryCrafter): Использует сжатие через VAE (Variational Autoencoder). Потери информации происходят на этапе кодирования: VAE «сглаживает» геометрию еще до начала генерации, что делает невозможным восстановление мелких деталей.
Решение: PointDiT в пиксельном пространстве
Авторы предлагают отказаться от VAE и латентных пространств. PointDiT работает напрямую с сырыми данными (data space). 3D-карта точек (H × W × 3, где каналы — это координаты XYZ) рассматривается как многоканальное изображение. Модель использует простой Vision Transformer (ViT), который:
- Разбивает зашумленную карту точек на токены (patchify, p=16).
- Кодирует входное изображение с помощью замороженного DINOv3.
- Объединяет токены и использует трансформер для денормализации (denoising) через flow matching.
Ключевое преимущество: отсутствие двухэтапного обучения и потери информации при сжатии. Модель может генерировать плотную 3D-карту за один шаг (1-step), а дополнительные шаги лишь уточняют мелкие детали.
Сравнение с состоянием искусства
В контролируемом эксперименте авторы сравнили генеративный подход (flow matching) с детерминированной регрессией при идентичных архитектурах и данных. Генеративная модель показала стабильное обучение без переобучения и лучшие метрики качества границ (BF1).
| Метрика / Характеристика | MoGe-2 (Регрессия) | GeometryCrafter (Latent Diffusion) | PointDiT (Pixel-Space Diffusion) |
|---|---|---|---|
| Метод обработки данных | Прямая регрессия (mean) | Сжатие через VAE + диффузия | Диффузия в пиксельном пространстве (XYZ) |
| Потери деталей | Высокие (усреднение) | Высокие (потери VAE) | Минимальные |
| Количество шагов генерации | 1 (детерминировано) | Множество (iterative) | 1 (базовый), можно уточнять |
| Метрика BF1 (контролируемый тест) | 10.90 | Информация недостаточна | 13.92 |
Почему это важно
PointDiT демонстрирует, что сложность гибридных архитектур не всегда необходима для достижения высокой точности. Простой ViT, работающий с сырыми 3D-координатами, превосходит сложные регрессоры и латентные диффузионные модели в сохранении тонких структур и прозрачных объектов. Это открывает путь к созданию единых моделей для реконструкции и генерации 3D/4D сцен без потерь качества на этапе кодирования.
Детали публикации
Работа представлена на конференции ICML 2026. Авторы: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer. Исследование доступно на GitHub и arXiv.
Источник: Github ↗
