Инструменты6 августа 2026 г., 17:46 МСК🤖 Auto

DiffGI: Генерация 3D-одежды за 1.2 сек на CPU с субпиксельной точностью

Новая модель DiffGI решает проблему тонкостенных объектов, генерируя высокодетализированную 3D-геометрию одежды из одного изображения за секунды, обходя конкурентов по компактности и скорости.

Баннер новости 5224

Прорыв в представлении тонких структур

Традиционные методы 3D-генерации часто страдают от «залипания» тонких объектов (например, складок одежды или тонких рам мебели), так как используют водонепроницаемые (watertight) объемные модели. DiffGI (Differentiable Geometry Images) предлагает альтернативу: использование многокарточных геометрий изображений (multi-chart geometry images) для обучения тонкостенных, неориентируемых поверхностей. Ключевая инновация — непрерывное расстояние до поверхности (TSDF) в сочетании с дифференцируемым алгоритмом маршевых квадратов (Differentiable Marching Squares). Это позволяет получать границы с субпиксельной точностью, избегая артефактов «лесенки» и разрывов, характерных для бинарных карт занятости.

Архитектура: от 2D к 3D за один шаг

Пайплайн DiffGI работает через сжатие 3D-меша в компактный латентный вектор размером 32×32 с помощью DiffGI-VAE. Декодер восстанавливает карту TSDF, а модуль DMS извлекает из нее 3D-поверхность. Благодаря дифференцируемости DMS, градиенты от потерь в пиксельном пространстве (позиция, нормали) обратно распространяются прямо в 2D-латент. На этом латентном пространстве обучается трансформерная диффузионная модель для условной генерации. Такой подход обеспечивает гладкую интерполяцию латентного пространства, что критично для создания разнообразных 3D-объектов.

Сравнение с SOTA: меньше вершин, выше качество

В тестах на наборе данных GarmageSet DiffGI демонстрирует беспрецедентную эффективность. Модель генерирует меши с количеством вершин в среднем ≈23 000, что на порядки меньше, чем у конкурентов (TRELLIS, TRELLIS.2, GarmageNet), при этом показывая лучшие метрики геометрической точности (CD и MD). Это делает DiffGI идеальным решением для приложений, где важна легковесность моделей без потери детализации.

Метод Ср. кол-во вершин CD (↓) MD F1 (↑) BCD (↓)
TRELLIS 109K 3.44 0.28 15.38
TRELLIS.2 380K 11.01 0.27 69.70
GarmageNet 526K 4.31 0.20 23.76
DiffGI (Ours) 23K 1.35 0.48 8.42

Скорость и доступность: от GPU до CPU

Одним из главных преимуществ DiffGI является вычислительная эффективность. Генерация 3D-модели занимает всего ~1.2 секунды на потребительской видеокарте NVIDIA RTX 4070 (12GB VRAM) и может быть выполнена даже на процессоре (MacBook M4), хотя и с задержкой. Потребление памяти остается низким (3.22 GB VRAM на GPU), что позволяет масштабировать решение от серверов до edge-устройств. Для сравнения, аналогичная генерация в Omages занимает 52 секунды, а TRELLIS требует 16 GB VRAM.

Метод Железо VRAM (GB) Время (с)
TRELLIS-image RTX A6000 Ada 16.28 4.52
Omages RTX A6000 Ada 2.49 52.0
DiffGI RTX 4070 (12GB) 3.22 1.21
DiffGI MacBook M4 (CPU) 8.52

Значение для индустрии

Работа, представленная в ECCV 2026 авторами Eungjune Shim, Hansol Lee и Eunjung Ju, закрывает важный пробел в цифровом моде и геймдеве. Возможность быстрого получения чистых, тонкостенных 3D-моделей одежды из одного фото-снимка без необходимости ручной ретопологии или использования тяжелых серверных ресурсов открывает путь к массовому внедрению AI-генерации цифровых двойников одежды для виртуальных примерок и метавселенных.

Источник: Github ↗