Релиз модели21 июля 2026 г., 19:46 МСК🤖 Auto

SHELLS от Google: 3D-головы за 0.08 сек с 88% экономией памяти

Google представила SHELLS — feed-forward модель для реконструкции 3D-голов, которая работает в 3.5 раза быстрее аналогов и использует лишь 12% GPU-памяти, сохраняя топологическую согласованность.

Баннер новости 4060

Революция в скорости и эффективности

Команда Google во главе с Тимом Болкартом представила SHELLS (Semantic Head Estimation via Layered Local Sampling) — новую архитектуру для восстановления 3D-голов по множеству изображений. В отличие от традиционных методов, которые обрабатывают вершины независимо и требуют огромных объемов памяти, SHELLS использует иерархическую стратегию выборки. Это позволяет предсказывать плотные семантические сетки с 18 000 вершинами всего за 0.08 секунды.

Ключевое преимущество — декуплирование извлечения признаков от разрешения сетки. Модель использует backbone DinoV2 с адаптацией LoRA, проецирует признаки в разреженный глобальный облако точек и предсказывает промежуточную грубую сетку. Эта «грубая» модель служит направляющей для создания слоев выборки, что обеспечивает глобальную согласованность поверхности.

Сравнение с состоянием искусства (SOTA)

SHELLS демонстрирует прорывные метрики по сравнению с существующими методами, основанными на объемных признаках (volume-based approaches). Модель не только быстрее, но и значительно экономичнее, что критично для применения в реальном времени и на мобильных устройствах.

Метрика SHELLS Предшествующие SOTA методы
Время реконструкции (18k вершин) 0.08 сек ~0.28 сек (в 3.5x медленнее)
Использование GPU-памяти 12% от объема SOTA 100% (базовый уровень)
Снижение ошибки регистрации 21% – 29% Базовый уровень
Количество вершин 18 000 Зависит от метода (часто менее плотно)

Устойчивость к окклюзиям и количеству камер

Архитектура SHELLS решает проблему скрытых областей (например, внутренней полости рта) за счет корреляции видимых участков с невидимыми, регрессируя все вершины холистически. Кроме того, благодаря случайному отключению камер во время обучения и слиянию признаков по среднему значению и дисперсии, модель устойчива к разному количеству входных видов.

  • Минимум: корректная реконструкция возможна уже при 2 видах (даже с большими диспаритетами).
  • Масштабируемость: качество плавно растет при добавлении 3, 4 или 10 камер.

Обобщение без реальных данных

Важнейшая особенность SHELLS — обучение исключительно на синтетических данных. При этом модель эффективно обобщается на реальные захваты, устраняя необходимость в дорогостоящих предварительно зарегистрированных наборах данных с множественными видами, которые были стандартом для предыдущих подходов. Работа представлена на конференции SIGGRAPH 2026.

Источник: Github ↗