Релиз модели10 июля 2026 г., 11:45 МСК🤖 Auto

PointDiT: Одношаговая генерация 3D-геометрии из одного изображения

Исследователи из Google, ETH Zurich и других лабораторий представили PointDiT — модель на базе ViT, которая восстанавливает плотную 3D-карту точек из одного изображения за один шаг диффузии, избегая потерь качества, свойственных VAE.

Баннер новости 3287

Проблема существующих подходов

Традиционные методы оценки 3D-геометрии по одному изображению (monocular geometry estimation) делятся на два лагеря, каждый из которых жертвует детализацией:

  • Детерминированная регрессия (например, MoGe-2): Сеть предсказывает «среднее» значение. При неоднозначности сцены модель размывает тонкие структуры (например, спицы стула) и прозрачные объекты, усредняя возможные варианты.
  • Латентная диффузия (например, GeometryCrafter): Использует сжатие через VAE (Variational Autoencoder). Потери информации происходят на этапе кодирования: VAE «сглаживает» геометрию еще до начала генерации, что делает невозможным восстановление мелких деталей.

Решение: PointDiT в пиксельном пространстве

Авторы предлагают отказаться от VAE и латентных пространств. PointDiT работает напрямую с сырыми данными (data space). 3D-карта точек (H × W × 3, где каналы — это координаты XYZ) рассматривается как многоканальное изображение. Модель использует простой Vision Transformer (ViT), который:

  1. Разбивает зашумленную карту точек на токены (patchify, p=16).
  2. Кодирует входное изображение с помощью замороженного DINOv3.
  3. Объединяет токены и использует трансформер для денормализации (denoising) через flow matching.

Ключевое преимущество: отсутствие двухэтапного обучения и потери информации при сжатии. Модель может генерировать плотную 3D-карту за один шаг (1-step), а дополнительные шаги лишь уточняют мелкие детали.

Сравнение с состоянием искусства

В контролируемом эксперименте авторы сравнили генеративный подход (flow matching) с детерминированной регрессией при идентичных архитектурах и данных. Генеративная модель показала стабильное обучение без переобучения и лучшие метрики качества границ (BF1).

Метрика / Характеристика MoGe-2 (Регрессия) GeometryCrafter (Latent Diffusion) PointDiT (Pixel-Space Diffusion)
Метод обработки данных Прямая регрессия (mean) Сжатие через VAE + диффузия Диффузия в пиксельном пространстве (XYZ)
Потери деталей Высокие (усреднение) Высокие (потери VAE) Минимальные
Количество шагов генерации 1 (детерминировано) Множество (iterative) 1 (базовый), можно уточнять
Метрика BF1 (контролируемый тест) 10.90 Информация недостаточна 13.92

Почему это важно

PointDiT демонстрирует, что сложность гибридных архитектур не всегда необходима для достижения высокой точности. Простой ViT, работающий с сырыми 3D-координатами, превосходит сложные регрессоры и латентные диффузионные модели в сохранении тонких структур и прозрачных объектов. Это открывает путь к созданию единых моделей для реконструкции и генерации 3D/4D сцен без потерь качества на этапе кодирования.

Детали публикации

Работа представлена на конференции ICML 2026. Авторы: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer. Исследование доступно на GitHub и arXiv.

Источник: Github ↗