От примитивов к объектам: новая парадигма
Традиционные методы 3D-реконструкции (включая 3D Gaussian Splatting) часто выдают плотные, неструктурированные облака точек или гауссианы, где структура объектов восстанавливается постфактум. Instok3D предлагает иной подход: сцена представляется как набор instance-structured 3D token groups (групп токенов, структурированных по экземплярам). Каждая группа состоит из «токена экземпляра» (отвечает за идентичность объекта) и «якорных токенов» (кодируют локальную геометрию и внешний вид), которые декодируются в 3D-гауссианы. Это позволяет работать с объектами как с первоклассными единицами сцены.
Архитектура: от VGGT к инстансам
Модель работает в режиме feed-forward (без итеративной оптимизации для каждой сцены). Процесс включает:
- Кодирование: Замороженная фундаментальная 3D-модель VGGT извлекает признаки и pointmaps из некалиброванных RGB-изображений.
- Декодирование: Трансформер привязывает якорные токены к контексту, а другой трансформер группирует их, используя механизм, аналогичный slot competition (softmax-присвоение).
- Обучение: Модель обучается end-to-end с использованием только 2D-супервизии (потери рендеринга RGB + потери сегментации масок). 3D-аннотации не требуются.
Результаты: компактность и точность
На датасете ScanNet Instok3D демонстрирует выдающиеся результаты как в качестве реконструкции, так и в сегментации. Ключевое преимущество — колоссальная компактность семантических единиц: вместо 131 072 гауссиан на пиксель модель использует менее 100 токенов на сцену.
Сравнение с базовыми методами
Ниже приведены метрики реконструкции и подъема признаков (feature lifting) на 2 контекстных видах:
| Метод | Src mIoU ↑ | Tgt mIoU ↑ | PSNR ↑ | SSIM ↑ | Кол-во сем. единиц ↓ | Размер признаков ↓ |
|---|---|---|---|---|---|---|
| LSM | 0.527 | 0.512 | 24.24 | 0.821 | 131,072 | 67.1 M |
| Uni3R | 0.540 | 0.558 | 25.53 | 0.873 | 131,072 | 8.4 M |
| C3G | 0.542 | 0.513 | 23.89 | 0.770 | 2,048 | 1.0 M |
| Instok3D (Ours) | 0.661 | 0.657 | 25.28 | 0.771 | <100 | 59.4 K |
В задаче class-agnostic instance segmentation (8 контекстных видов) Instok3D превосходит методы, требующие пересценовой оптимизации:
| Тип метода | Метод | AP ↑ | AP₅₀ ↑ | AP₂₅ ↑ |
|---|---|---|---|---|
| Per-scene opt. | Gaussian Grouping | 0.139 | 0.288 | 0.440 |
| Per-scene opt. | ObjectGS | 0.178 | 0.337 | 0.489 |
| FF + opt. | IGGT + LUDVIG | 0.122 | 0.265 | 0.442 |
| Feed-forward | Instok3D | 0.235 | 0.438 | 0.564 |
Практическое применение
Благодаря объектной структуре, Instok3D открывает новые возможности для работы со сценами:
- Редактирование сцены: Удаление, перемещение или вставка объектов происходят на уровне токенов, не затрагивая фон или соседей.
- Поиск по тексту: Поддерживается open-vocabulary retrieval. Сложность поиска масштабируется с количеством объектов, а не примитивов.
- Синтез новых видов: Высококачественный рендеринг за один проход сети.
Бенчмарки
| Бенчмарк | Instok3D | C3G | Gaussian Grouping | IGGT + LUDVIG | LSM | ObjectGS | Uni3R |
|---|---|---|---|---|---|---|---|
| ScanNet Src mIoU | 66.1% | 54.2% | — | — | 52.7% | — | 54% |
| ScanNet Tgt mIoU | 65.7% | 51.3% | — | — | 51.2% | — | 55.8% |
| ScanNet PSNR | 25.28dB | 23.89dB | — | — | 24.24dB | — | 25.53dB |
| ScanNet SSIM | 0.771score | 0.77score | — | — | 0.821score | — | 0.873score |
| ScanNet LPIPS | 0.238score | 0.285score | — | — | 0.222score | — | 0.138score |
| ScanNet Instance Segmentation AP | 23.5% | — | 13.9% | 12.2% | — | 17.8% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
