Релиз модели10 июля 2026 г., 19:46 МСК🤖 Auto

GaussianGPT: Автогенерация 3D-сцен через токены, а не диффузию

Команда из ТУ Мюнхена представила GaussianGPT — первую модель, создающую 3D-сцены из гауссиан методом next-token prediction, обойдясь без диффузии.

Баннер новости 3319

Почему это прорыв

Большинство современных 3D-генераторов (Midjourney 3D, Luma, Stable Video 3D) опираются на диффузионные модели или flow-matching. GaussianGPT, принятый в ECCV 2026, предлагает альтернативу: полностью авторегрессионный подход. Модель генерирует 3D-сцену последовательно, предсказывая следующий «токен» за предыдущим, подобно тому, как LLM генерируют текст. Это дает естественную поддержку завершения сцен (completion), outpainting и контроля через температуру (temperature).

Архитектура: от гауссиан к токенам

Пайплайн состоит из двух ключевых этапов:

  • VQ-VAE (Vector Quantized VAE): Сжатие непрерывных 3D-гауссиан в дискретную сетку токенов с помощью разреженной 3D-сверточной автоэнкодера. Обучение идет с потерей пере-рендеринга (gsplat loss).
  • GPT (Transformer): Авторегрессионная трансформерная модель с 3D-ротационными позиционными эмбеддингами (3D RoPE), которая моделирует последовательность токенов.

Технические детали и требования

Для работы требуется CUDA 12.9 и PyTorch 2.8. Особое внимание уделено совместимости библиотек:

  • Flash Attention v2.8.2: Обязательно для ускорения внимания.
  • MinkowskiEngine: Требуется форк alpsaur/MinkowskiEngine с патчами для CUDA 12, так как оригинальная версия не компилируется с GCC 14+.
  • GPU: Рекомендуется Ampere (RTX 3090, A6000, A100) с архитектурой sm_80/sm_86.

Данные и бенчмарки

Модель обучалась на наборах данных PhotoShape и 3D-FRONT (оптимизированных через Voxel-GS). В исходных данных 3D-FRONT оригинальные файлы утеряны, но используются ре-релизы. Архитектура позволяет генерировать сцены с разной плотностью гауссиан, сохраняя совместимость с современными пайплайнами нейрорендеринга.

Компонент Описание Ключевые параметры
VQ-VAE Сжатие 3D-гауссиан в токены Разреженная 3D CNN, Vector Quantization, gsplat loss
GPT Генерация последовательности токенов Transformer, 3D RoPE, Next-token prediction
Render Восстановление и рендеринг Decoding через frozen VQ-VAE, gsplat renderer
Env Среда выполнения CUDA 12.9, PyTorch 2.8, GCC <= 13

Где взять код

Полный код, веса предобученных моделей (checkpoints) и инструкции по установке опубликованы на GitHub. Дата релиза чекпоинтов: 1 июля 2026 года. Исследование выполнено Nicolas von Lützow, Barbara Rössle, Katharina Schmid и Matthias Nießner из Technical University of Munich.

Источник: Github ↗