Прорыв в представлении тонких структур
Традиционные методы 3D-генерации часто страдают от «залипания» тонких объектов (например, складок одежды или тонких рам мебели), так как используют водонепроницаемые (watertight) объемные модели. DiffGI (Differentiable Geometry Images) предлагает альтернативу: использование многокарточных геометрий изображений (multi-chart geometry images) для обучения тонкостенных, неориентируемых поверхностей. Ключевая инновация — непрерывное расстояние до поверхности (TSDF) в сочетании с дифференцируемым алгоритмом маршевых квадратов (Differentiable Marching Squares). Это позволяет получать границы с субпиксельной точностью, избегая артефактов «лесенки» и разрывов, характерных для бинарных карт занятости.
Архитектура: от 2D к 3D за один шаг
Пайплайн DiffGI работает через сжатие 3D-меша в компактный латентный вектор размером 32×32 с помощью DiffGI-VAE. Декодер восстанавливает карту TSDF, а модуль DMS извлекает из нее 3D-поверхность. Благодаря дифференцируемости DMS, градиенты от потерь в пиксельном пространстве (позиция, нормали) обратно распространяются прямо в 2D-латент. На этом латентном пространстве обучается трансформерная диффузионная модель для условной генерации. Такой подход обеспечивает гладкую интерполяцию латентного пространства, что критично для создания разнообразных 3D-объектов.
Сравнение с SOTA: меньше вершин, выше качество
В тестах на наборе данных GarmageSet DiffGI демонстрирует беспрецедентную эффективность. Модель генерирует меши с количеством вершин в среднем ≈23 000, что на порядки меньше, чем у конкурентов (TRELLIS, TRELLIS.2, GarmageNet), при этом показывая лучшие метрики геометрической точности (CD и MD). Это делает DiffGI идеальным решением для приложений, где важна легковесность моделей без потери детализации.
| Метод | Ср. кол-во вершин | CD (↓) | MD F1 (↑) | BCD (↓) |
|---|---|---|---|---|
| TRELLIS | 109K | 3.44 | 0.28 | 15.38 |
| TRELLIS.2 | 380K | 11.01 | 0.27 | 69.70 |
| GarmageNet | 526K | 4.31 | 0.20 | 23.76 |
| DiffGI (Ours) | 23K | 1.35 | 0.48 | 8.42 |
Скорость и доступность: от GPU до CPU
Одним из главных преимуществ DiffGI является вычислительная эффективность. Генерация 3D-модели занимает всего ~1.2 секунды на потребительской видеокарте NVIDIA RTX 4070 (12GB VRAM) и может быть выполнена даже на процессоре (MacBook M4), хотя и с задержкой. Потребление памяти остается низким (3.22 GB VRAM на GPU), что позволяет масштабировать решение от серверов до edge-устройств. Для сравнения, аналогичная генерация в Omages занимает 52 секунды, а TRELLIS требует 16 GB VRAM.
| Метод | Железо | VRAM (GB) | Время (с) |
|---|---|---|---|
| TRELLIS-image | RTX A6000 Ada | 16.28 | 4.52 |
| Omages | RTX A6000 Ada | 2.49 | 52.0 |
| DiffGI | RTX 4070 (12GB) | 3.22 | 1.21 |
| DiffGI | MacBook M4 (CPU) | 8.52 | — |
Значение для индустрии
Работа, представленная в ECCV 2026 авторами Eungjune Shim, Hansol Lee и Eunjung Ju, закрывает важный пробел в цифровом моде и геймдеве. Возможность быстрого получения чистых, тонкостенных 3D-моделей одежды из одного фото-снимка без необходимости ручной ретопологии или использования тяжелых серверных ресурсов открывает путь к массовому внедрению AI-генерации цифровых двойников одежды для виртуальных примерок и метавселенных.
Источник: Github ↗
