Команда исследователей из Университета Токио (Keito Abe, Kaede Shiohara, Takashi Otonari, Toshihiko Yamasaki) представила метод GUSH3R (Gaussian-unified Scene Human Reconstruction). Это первая feed-forward архитектура, способная одновременно реконструировать динамических людей и статичную среду, используя только монокулярное видео. В отличие от традиционных оптимизационных методов, требующих длительного обучения для каждого нового видео, GUSH3R работает в режиме реального времени, генерируя геометрически согласованные примитивы 3D Gaussian Splatting (3DGS).
Архитектура: Два декодера для единой цели
Ключевая инновация GUSH3R заключается в разделении задачи на два специализированных потока обработки, которые затем объединяются в едином метрическом пространстве:
- Scene Gaussian Decoder: Использует облака точек как геометрический приоритет и предсказывает сценовые гауссианы на основе image-токенов через Dense Prediction Transformer.
- Human Gaussian Decoder: Использует сетки человека (human meshes) как приоритет и предсказывает гауссианы тела, используя как image, так и human-токены через Human Gaussian Transformer.
Оба декодера питаются от фундаментальной модели Human3R, которая извлекает токены человека и изображения, а также генерирует начальные облака точек и вершины сеток.
Почему это важно: Скорость против качества
Проблема реконструкции динамических сцен из одного видео (monocular) исторически решалась либо через медленные оптимизационные методы, либо через feed-forward модели, которые жертвовали фотореализмом (используя только point clouds или meshes). GUSH3R заполняет этот пробел, обеспечивая:
- Синтез новых ракурсов (Novel View Synthesis): Высокое качество рендеринга благодаря использованию 3DGS.
- Эффективность: Значительное ускорение инференса по сравнению с методами, основанными на оптимизации.
- Единое представление: Отсутствие артефактов на границе «человек-фон» благодаря совместному обучению в одном пространстве.
Результаты и доступность
Эксперименты на монокулярных датасетах показывают, что GUSH3R достигает конкурентоспособных результатов по качеству синтеза новых видов, при этом значительно превосходя оптимизационные подходы по скорости. Код и модель доступны на странице проекта.
| Характеристика | Традиционные оптимизационные методы | Ранее существующие Feed-Forward методы | GUSH3R (предлагаемый метод) |
|---|---|---|---|
| Тип представления | 3DGS / NeRF (высокое качество) | Point Clouds / Meshes (низкое качество рендеринга) | 3D Gaussian Splatting (высокое качество) |
| Скорость инференса | Медленно (минуты/часы на видео) | Быстро (миллисекунды) | Быстро (online reconstruction) |
| Входные данные | Монокулярное видео | Монокулярное видео | Монокулярное видео |
| Динамические люди | Да | Часто нет или с ограничениями | Да (полная поддержка) |
Источник: Github ↗
