Почему это прорыв
Большинство современных 3D-генераторов (Midjourney 3D, Luma, Stable Video 3D) опираются на диффузионные модели или flow-matching. GaussianGPT, принятый в ECCV 2026, предлагает альтернативу: полностью авторегрессионный подход. Модель генерирует 3D-сцену последовательно, предсказывая следующий «токен» за предыдущим, подобно тому, как LLM генерируют текст. Это дает естественную поддержку завершения сцен (completion), outpainting и контроля через температуру (temperature).
Архитектура: от гауссиан к токенам
Пайплайн состоит из двух ключевых этапов:
- VQ-VAE (Vector Quantized VAE): Сжатие непрерывных 3D-гауссиан в дискретную сетку токенов с помощью разреженной 3D-сверточной автоэнкодера. Обучение идет с потерей пере-рендеринга (gsplat loss).
- GPT (Transformer): Авторегрессионная трансформерная модель с 3D-ротационными позиционными эмбеддингами (3D RoPE), которая моделирует последовательность токенов.
Технические детали и требования
Для работы требуется CUDA 12.9 и PyTorch 2.8. Особое внимание уделено совместимости библиотек:
- Flash Attention v2.8.2: Обязательно для ускорения внимания.
- MinkowskiEngine: Требуется форк
alpsaur/MinkowskiEngineс патчами для CUDA 12, так как оригинальная версия не компилируется с GCC 14+. - GPU: Рекомендуется Ampere (RTX 3090, A6000, A100) с архитектурой sm_80/sm_86.
Данные и бенчмарки
Модель обучалась на наборах данных PhotoShape и 3D-FRONT (оптимизированных через Voxel-GS). В исходных данных 3D-FRONT оригинальные файлы утеряны, но используются ре-релизы. Архитектура позволяет генерировать сцены с разной плотностью гауссиан, сохраняя совместимость с современными пайплайнами нейрорендеринга.
| Компонент | Описание | Ключевые параметры |
|---|---|---|
| VQ-VAE | Сжатие 3D-гауссиан в токены | Разреженная 3D CNN, Vector Quantization, gsplat loss |
| GPT | Генерация последовательности токенов | Transformer, 3D RoPE, Next-token prediction |
| Render | Восстановление и рендеринг | Decoding через frozen VQ-VAE, gsplat renderer |
| Env | Среда выполнения | CUDA 12.9, PyTorch 2.8, GCC <= 13 |
Где взять код
Полный код, веса предобученных моделей (checkpoints) и инструкции по установке опубликованы на GitHub. Дата релиза чекпоинтов: 1 июля 2026 года. Исследование выполнено Nicolas von Lützow, Barbara Rössle, Katharina Schmid и Matthias Nießner из Technical University of Munich.
Источник: Github ↗
