Проблема разреженных захватов
Существующие методы объемного захвата (volumetric capture) требуют плотных массивов камер для достижения высокой детализации. В реальных условиях, где доступно лишь несколько камер с низким перекрытием (low-overlap), качество реконструкции резко падает, а значительные области сцены остаются невидимыми. Существующие решения либо оставляют артефакты в незасвеченных зонах, либо используют видео-диффузионные модели, которые часто дают геометрически несогласованные результаты для людей.
Архитектура StudioRecon
Команда из Сеульского национального университета (SNU) предложила конвейер, разделяющий фон и человека. Метод состоит из четырех ключевых этапов:
- Синтез видов (Sparse-to-Dense View Synthesis): Использование видео-диффузионной модели с контролем камеры для генерации сотен новых ракурсов из исходных 4-х кадров.
- Оценка позы (Multi-view Human Pose Estimation): Кросс-видовая ассоциация идентичности и 3D-триангуляция ключевых точек для точного позиционирования человека.
- Декупированная реконструкция (Decoupled Gaussian Reconstruction): Оптимизация фона на синтезированных видах, а человека — на оригинальных видео с использованием деформируемых гауссиан.
- Рекурсивное улучшение (Recursive Enhancement Module): Модуль с инъекцией согласованности, адаптированной к движению, для устранения остаточных артефактов и обеспечения временной когерентности.
Результаты и сравнение
Метод демонстрирует состояние искусства (SOTA) в синтезе новых видов на четырех реальных наборах данных. Ниже приведено качественное сравнение с существующими методами (Dyn3DGS, MonoFusion, STG) на сцене с каратэ:
| Метод | Качество фона | Геометрия человека | Артефакты движения |
|---|---|---|---|
| Ground Truth | Идеально | Идеально | Отсутствуют |
| Dyn3DGS | Хорошо | Средне (размытие) | Высокие |
| MonoFusion | Средне | Плохо (искажения) | Высокие |
| STG | Хорошо | Средне | Средние |
| StudioRecon (Ours) | Высокое (синтез) | Высокое (гауссианы) | Минимальные |
Практическое применение
Благодаря представлению в виде гауссиан, StudioRecon поддерживает рендеринг по произвольным траекториям камеры, включая эффект «dolly zoom» и осциллирующие движения. Также реализована функция замены актеров: поскольку фон и человек реконструируются независимо, можно заменить персонажа на новый образ, используя всего одно референсное изображение.
Значимость для индустрии
Работа опубликована в материалах конференции SIGGRAPH 2026. Доступен код на GitHub, что открывает возможности для создания «bullet-time» эффектов и интерактивных 3D-сцен с людьми в условиях ограниченного оборудования. Это решает критическую проблему доступности объемного захвата вне специализированных студий.
Источник: Github ↗
