Релиз модели8 июля 2026 г., 15:46 МСК🤖 Auto

GUSH3R: Реконструкция людей и сцен из одного видео за один проход

Исследователи из Токийского университета представили GUSH3R — feed-forward модель, которая за один проход восстанавливает динамических людей и статичные сцены в едином 3D-пространстве из монокулярного видео.

Баннер новости 3114

Команда исследователей из Университета Токио (Keito Abe, Kaede Shiohara, Takashi Otonari, Toshihiko Yamasaki) представила метод GUSH3R (Gaussian-unified Scene Human Reconstruction). Это первая feed-forward архитектура, способная одновременно реконструировать динамических людей и статичную среду, используя только монокулярное видео. В отличие от традиционных оптимизационных методов, требующих длительного обучения для каждого нового видео, GUSH3R работает в режиме реального времени, генерируя геометрически согласованные примитивы 3D Gaussian Splatting (3DGS).

Архитектура: Два декодера для единой цели

Ключевая инновация GUSH3R заключается в разделении задачи на два специализированных потока обработки, которые затем объединяются в едином метрическом пространстве:

  • Scene Gaussian Decoder: Использует облака точек как геометрический приоритет и предсказывает сценовые гауссианы на основе image-токенов через Dense Prediction Transformer.
  • Human Gaussian Decoder: Использует сетки человека (human meshes) как приоритет и предсказывает гауссианы тела, используя как image, так и human-токены через Human Gaussian Transformer.

Оба декодера питаются от фундаментальной модели Human3R, которая извлекает токены человека и изображения, а также генерирует начальные облака точек и вершины сеток.

Почему это важно: Скорость против качества

Проблема реконструкции динамических сцен из одного видео (monocular) исторически решалась либо через медленные оптимизационные методы, либо через feed-forward модели, которые жертвовали фотореализмом (используя только point clouds или meshes). GUSH3R заполняет этот пробел, обеспечивая:

  1. Синтез новых ракурсов (Novel View Synthesis): Высокое качество рендеринга благодаря использованию 3DGS.
  2. Эффективность: Значительное ускорение инференса по сравнению с методами, основанными на оптимизации.
  3. Единое представление: Отсутствие артефактов на границе «человек-фон» благодаря совместному обучению в одном пространстве.

Результаты и доступность

Эксперименты на монокулярных датасетах показывают, что GUSH3R достигает конкурентоспособных результатов по качеству синтеза новых видов, при этом значительно превосходя оптимизационные подходы по скорости. Код и модель доступны на странице проекта.

Характеристика Традиционные оптимизационные методы Ранее существующие Feed-Forward методы GUSH3R (предлагаемый метод)
Тип представления 3DGS / NeRF (высокое качество) Point Clouds / Meshes (низкое качество рендеринга) 3D Gaussian Splatting (высокое качество)
Скорость инференса Медленно (минуты/часы на видео) Быстро (миллисекунды) Быстро (online reconstruction)
Входные данные Монокулярное видео Монокулярное видео Монокулярное видео
Динамические люди Да Часто нет или с ограничениями Да (полная поддержка)

Источник: Github ↗