Проблема существующих подходов
Восстановление полной 4D-сцены (3D-геометрия + время) из одного видео — сложная задача. Существующие методы делятся на два типа, каждый из которых имеет критические недостатки:
- Прямое предсказание: Модели учатся генерировать 3D-представление для каждого кадра. Они ограничены нехваткой данных для обучения 4D-сцен.
- Инициализация и деформация: Сначала создается статичная 3D-модель, которая затем деформируется под видео. Приоры используются только на старте, а дальше модель полагается только на видеосупервизор, что плохо работает при сильных окклюзиях (перекрытиях) и сложных движениях.
Решение: Lift4D
Команда Carnegie Mellon University (CMU) предложила фреймворк оптимизации на этапе тестирования, который объединяет сильные стороны обоих подходов. Метод работает в два этапа:
- Временная согласованность: Используется модель Image-to-3D DiT. Для обеспечения согласованности кадров применяется causal latent propagation (причинное распространение латентных переменных): латент каждого кадра инициализируется смесью нового шума и предыдущего денормализованного латента. Это дает стабильную начальную точку.
- Скульптинг и заполнение: Полученные гауссовы сплэты (Gaussian Splatting) объединяются в единую 4D-модель. Оптимизация учитывает окклюзии: видимые детали восстанавливаются через рендеринг, а невидимые области «додумываются» с помощью диффузионногоpriora, обученного на новых ракурсах.
Технические детали и метрики
Ключевая инновация — использование occlusion-aware optimization (оптимизации, aware к окклюзиям). Модель рендерит сцену из случайных новых ракурсов, добавляет шум и использует диффузионную модель для его удаления,_conditioned_ на кадры, где окклюзии были предварительно заполнены. Это позволяет агрегировать детали из разных кадров и hallucinate (генерировать правдоподобно) то, что камера не видела.
Сравнение с базовыми методами показывает преимущество Lift4D в качестве геометрии и текстуры, особенно на сложных видео «in-the-wild»:
| Характеристика | Lift4D (Proposed) | Предыдущие SOTA методы |
|---|---|---|
| Входные данные | Монокулярное видео (in-the-wild) | Монокулярное видео / Множество видов |
| Обработка окклюзий | Через диффузионный prior + inpainting | Часто игнорируются или приводят к артефактам |
| Временная согласованность | Высокая (Causal Latent Propagation) | Низкая/Средняя (дрожание геометрии) |
| Заполнение невидимых зон | Да (view-conditioned diffusion) | Нет или грубое заполнение |
Значение для индустрии
Lift4D демонстрирует, что можно достичь полного 4D-реконструирования без необходимости в множестве камер или специализированных датчиках глубины. Это открывает путь к созданию фотореалистичных цифровых двойников объектов из обычных видео, записанных на смартфон, что критически важно для AR/VR, робототехники и создания контента.
Источник: Github ↗
