Релиз модели4 августа 2026 г., 21:45 МСК🤖 Auto

Lift4D: Реконструкция 4D-объектов по одному видео с помощью диффузии

Исследователи из CMU представили Lift4D — метод, который восстанавливает полную геометрию, текстуру и деформацию динамических объектов из единственного монокулярного видео, даже в сложных условиях.

Баннер новости 5068

Проблема существующих подходов

Восстановление полной 4D-сцены (3D-геометрия + время) из одного видео — сложная задача. Существующие методы делятся на два типа, каждый из которых имеет критические недостатки:

  • Прямое предсказание: Модели учатся генерировать 3D-представление для каждого кадра. Они ограничены нехваткой данных для обучения 4D-сцен.
  • Инициализация и деформация: Сначала создается статичная 3D-модель, которая затем деформируется под видео. Приоры используются только на старте, а дальше модель полагается только на видеосупервизор, что плохо работает при сильных окклюзиях (перекрытиях) и сложных движениях.

Решение: Lift4D

Команда Carnegie Mellon University (CMU) предложила фреймворк оптимизации на этапе тестирования, который объединяет сильные стороны обоих подходов. Метод работает в два этапа:

  1. Временная согласованность: Используется модель Image-to-3D DiT. Для обеспечения согласованности кадров применяется causal latent propagation (причинное распространение латентных переменных): латент каждого кадра инициализируется смесью нового шума и предыдущего денормализованного латента. Это дает стабильную начальную точку.
  2. Скульптинг и заполнение: Полученные гауссовы сплэты (Gaussian Splatting) объединяются в единую 4D-модель. Оптимизация учитывает окклюзии: видимые детали восстанавливаются через рендеринг, а невидимые области «додумываются» с помощью диффузионногоpriora, обученного на новых ракурсах.

Технические детали и метрики

Ключевая инновация — использование occlusion-aware optimization (оптимизации, aware к окклюзиям). Модель рендерит сцену из случайных новых ракурсов, добавляет шум и использует диффузионную модель для его удаления,_conditioned_ на кадры, где окклюзии были предварительно заполнены. Это позволяет агрегировать детали из разных кадров и hallucinate (генерировать правдоподобно) то, что камера не видела.

Сравнение с базовыми методами показывает преимущество Lift4D в качестве геометрии и текстуры, особенно на сложных видео «in-the-wild»:

Характеристика Lift4D (Proposed) Предыдущие SOTA методы
Входные данные Монокулярное видео (in-the-wild) Монокулярное видео / Множество видов
Обработка окклюзий Через диффузионный prior + inpainting Часто игнорируются или приводят к артефактам
Временная согласованность Высокая (Causal Latent Propagation) Низкая/Средняя (дрожание геометрии)
Заполнение невидимых зон Да (view-conditioned diffusion) Нет или грубое заполнение

Значение для индустрии

Lift4D демонстрирует, что можно достичь полного 4D-реконструирования без необходимости в множестве камер или специализированных датчиках глубины. Это открывает путь к созданию фотореалистичных цифровых двойников объектов из обычных видео, записанных на смартфон, что критически важно для AR/VR, робототехники и создания контента.

Источник: Github ↗