Релиз модели4 августа 2026 г., 23:46 МСК🤖 Auto

QuerySplat: Прорыв в 3DGS с разделением геометрии и внешнего вида

Исследователи из Beihang University и Zhejiang University представили QuerySplat — новую архитектуру для быстрого 3D-реконструирования, которая достигает SOTA на DL3DV, улучшая PSNR на 2.30 дБ.

Баннер новости 5076

Проблема существующих методов 3DGS

Feed-forward 3D Gaussian Splatting (3DGS) позволяет быстро восстанавливать 3D-сцены, но качество рендеринга часто страдает. Существующие подходы делятся на два лагеря, каждый со своими недостатками:

  • Pixel-aligned методы: Страдают от пространственной негибкости и огромной структурной избыточности данных.
  • Query-based методы: Не имеют 3D-приоров, запутывают геометрию с внешним видом (appearance), что приводит к размытым изображениям, зависящим от ракурса камеры.

Решение: QuerySplat

Авторы предлагают QuerySplat — фреймворк, который разделяет задачи предсказания геометрии и внешнего вида. Ключевые инновации:

  1. Двухветвевой декодер: Геометрическая ветвь использует предварительно обученную Vision Geometric Model (VGM) для понимания пространства, что дает модели способность к pose-free (независимому от позы) моделированию.
  2. Разделение атрибутов: Ветвь внешнего вида восстанавливает высокочастотные детали (цвет, Plücker-координаты) через отдельный канал, изолированный от регрессии геометрических параметров Гауссиана.
  3. Обучение: Полученные Гауссианы обучаются с помощью дифференцируемого сплаттинга в координатной системе, определенной VGM.

Результаты на бенчмарке DL3DV

Метод демонстрирует состояние искусства (SOTA) в задаче синтеза новых видов (novel view synthesis). Ниже приведено сравнение прироста качества (PSNR) относительно лучших базовых моделей:

Метрика Показатель Сравнение с
Прирост PSNR (avg) +2.30 dB Лучшие pose-free модели
Прирост PSNR (avg) +1.04 dB Лучшие pose-required модели
Качество рендеринга Выше Pixel-aligned подходы

Значение для индустрии

QuerySplat решает фундаментальную проблему запутывания геометрии и текстуры в нейросетевых 3D-реконструкциях. Использование VGM позволяет модели лучше понимать пространственную структуру сцены, что критически важно для создания фотореалистичных цифровых двойников и метавселенных без необходимости точного знания начальной позы камеры. Исследование опубликовано в arXiv (2026) и доступно на GitHub.

Источник: Github ↗