Релиз модели2 июля 2026 г., 19:46 МСК🤖 Auto

Instok3D: Объектно-ориентированная 3D-сцена без аннотаций

Исследователи представили Instok3D — feed-forward модель, которая реконструирует 3D-сцены из некалиброванных изображений, выделяя объекты как единые токены, а не хаотичные примитивы.

Баннер новости 2813

От примитивов к объектам: новая парадигма

Традиционные методы 3D-реконструкции (включая 3D Gaussian Splatting) часто выдают плотные, неструктурированные облака точек или гауссианы, где структура объектов восстанавливается постфактум. Instok3D предлагает иной подход: сцена представляется как набор instance-structured 3D token groups (групп токенов, структурированных по экземплярам). Каждая группа состоит из «токена экземпляра» (отвечает за идентичность объекта) и «якорных токенов» (кодируют локальную геометрию и внешний вид), которые декодируются в 3D-гауссианы. Это позволяет работать с объектами как с первоклассными единицами сцены.

Архитектура: от VGGT к инстансам

Модель работает в режиме feed-forward (без итеративной оптимизации для каждой сцены). Процесс включает:

  • Кодирование: Замороженная фундаментальная 3D-модель VGGT извлекает признаки и pointmaps из некалиброванных RGB-изображений.
  • Декодирование: Трансформер привязывает якорные токены к контексту, а другой трансформер группирует их, используя механизм, аналогичный slot competition (softmax-присвоение).
  • Обучение: Модель обучается end-to-end с использованием только 2D-супервизии (потери рендеринга RGB + потери сегментации масок). 3D-аннотации не требуются.

Результаты: компактность и точность

На датасете ScanNet Instok3D демонстрирует выдающиеся результаты как в качестве реконструкции, так и в сегментации. Ключевое преимущество — колоссальная компактность семантических единиц: вместо 131 072 гауссиан на пиксель модель использует менее 100 токенов на сцену.

Сравнение с базовыми методами

Ниже приведены метрики реконструкции и подъема признаков (feature lifting) на 2 контекстных видах:

Метод Src mIoU ↑ Tgt mIoU ↑ PSNR ↑ SSIM ↑ Кол-во сем. единиц ↓ Размер признаков ↓
LSM 0.527 0.512 24.24 0.821 131,072 67.1 M
Uni3R 0.540 0.558 25.53 0.873 131,072 8.4 M
C3G 0.542 0.513 23.89 0.770 2,048 1.0 M
Instok3D (Ours) 0.661 0.657 25.28 0.771 <100 59.4 K

В задаче class-agnostic instance segmentation (8 контекстных видов) Instok3D превосходит методы, требующие пересценовой оптимизации:

Тип метода Метод AP ↑ AP₅₀ ↑ AP₂₅ ↑
Per-scene opt. Gaussian Grouping 0.139 0.288 0.440
Per-scene opt. ObjectGS 0.178 0.337 0.489
FF + opt. IGGT + LUDVIG 0.122 0.265 0.442
Feed-forward Instok3D 0.235 0.438 0.564

Практическое применение

Благодаря объектной структуре, Instok3D открывает новые возможности для работы со сценами:

  • Редактирование сцены: Удаление, перемещение или вставка объектов происходят на уровне токенов, не затрагивая фон или соседей.
  • Поиск по тексту: Поддерживается open-vocabulary retrieval. Сложность поиска масштабируется с количеством объектов, а не примитивов.
  • Синтез новых видов: Высококачественный рендеринг за один проход сети.

Бенчмарки

БенчмаркInstok3DC3GGaussian GroupingIGGT + LUDVIGLSMObjectGSUni3R
ScanNet Src mIoU66.1%54.2%52.7%54%
ScanNet Tgt mIoU65.7%51.3%51.2%55.8%
ScanNet PSNR25.28dB23.89dB24.24dB25.53dB
ScanNet SSIM0.771score0.77score0.821score0.873score
ScanNet LPIPS0.238score0.285score0.222score0.138score
ScanNet Instance Segmentation AP23.5%13.9%12.2%17.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗