Проблема существующих методов
Стандартные генеративные 3D-модели (например, для создания объектов) часто не имеют явного контроля над положением камеры, что делает их непригодными для реконструкции сложных сцен. Они не могут гарантировать согласованность геометрии при просмотре с разных ракурсов. GenRecon решает эту проблему, объединяя реконструкцию с мощным генеративным prior'ом, масштабируя генерацию на уровень целых помещений.
Техническое ядро: Trellis.2 и пространственное условие
В основе метода лежит модель Trellis.2. Авторы предлагают механизм условной генерации на основе проекции: признаки из каждого входного изображения поднимаются в общую 3D-воксельную сетку через проекцию камеры. Это создает единое представление, инвариантное к порядку обзора, но пространственно привязанное к сцене. Сцена разбивается на перекрывающиеся 3D-чанки, которые генерируются совместно в общем латентном пространстве, обеспечивая согласованность на границах блоков.
Ключевые метрики и результаты
GenRecon способен создавать полные, редактируемые PBR-мешы (материалы с физически корректным рендерингом) всего из 8 входных изображений. Метод превосходит передовые методы реконструкции на 16% по качеству, особенно в зонах окклюзии и невидимых областях, где базовые методы дают шум или излишнее сглаживание.
| Метрика / Аспект | GenRecon (Ours) | Базовые методы (2DGS, DA3, FineRecon и др.) |
|---|---|---|
| Количество входных изображений | 8 (sparse set) | Зависит от метода, часто требуется больше данных |
| Качество реконструкции | Выше на 16% | Ниже (шум, сглаживание) |
| Работа с окклюзиями | Полная реконструкция | Неполная, пропуски |
| Выходные данные | PBR-меш, готовый к релайтингу | Часто только геометрия или сырые облака |
Практическое применение
Результатом работы является не просто «облако точек», а полноценная 3D-сцена с PBR-материалами, которую можно использовать в стандартных конвейерах рендеринга. Это открывает возможности для реалистичного релайтинга (пересвета) и редактирования сцен, созданных из обычных видео со смартфонов. Исследование выполнено в Technical University of Munich и Huawei Technologies, код и модель доступны на GitHub.
Источник: Github ↗
