Революция в скорости и эффективности
Команда Google во главе с Тимом Болкартом представила SHELLS (Semantic Head Estimation via Layered Local Sampling) — новую архитектуру для восстановления 3D-голов по множеству изображений. В отличие от традиционных методов, которые обрабатывают вершины независимо и требуют огромных объемов памяти, SHELLS использует иерархическую стратегию выборки. Это позволяет предсказывать плотные семантические сетки с 18 000 вершинами всего за 0.08 секунды.
Ключевое преимущество — декуплирование извлечения признаков от разрешения сетки. Модель использует backbone DinoV2 с адаптацией LoRA, проецирует признаки в разреженный глобальный облако точек и предсказывает промежуточную грубую сетку. Эта «грубая» модель служит направляющей для создания слоев выборки, что обеспечивает глобальную согласованность поверхности.
Сравнение с состоянием искусства (SOTA)
SHELLS демонстрирует прорывные метрики по сравнению с существующими методами, основанными на объемных признаках (volume-based approaches). Модель не только быстрее, но и значительно экономичнее, что критично для применения в реальном времени и на мобильных устройствах.
| Метрика | SHELLS | Предшествующие SOTA методы |
|---|---|---|
| Время реконструкции (18k вершин) | 0.08 сек | ~0.28 сек (в 3.5x медленнее) |
| Использование GPU-памяти | 12% от объема SOTA | 100% (базовый уровень) |
| Снижение ошибки регистрации | 21% – 29% | Базовый уровень |
| Количество вершин | 18 000 | Зависит от метода (часто менее плотно) |
Устойчивость к окклюзиям и количеству камер
Архитектура SHELLS решает проблему скрытых областей (например, внутренней полости рта) за счет корреляции видимых участков с невидимыми, регрессируя все вершины холистически. Кроме того, благодаря случайному отключению камер во время обучения и слиянию признаков по среднему значению и дисперсии, модель устойчива к разному количеству входных видов.
- Минимум: корректная реконструкция возможна уже при 2 видах (даже с большими диспаритетами).
- Масштабируемость: качество плавно растет при добавлении 3, 4 или 10 камер.
Обобщение без реальных данных
Важнейшая особенность SHELLS — обучение исключительно на синтетических данных. При этом модель эффективно обобщается на реальные захваты, устраняя необходимость в дорогостоящих предварительно зарегистрированных наборах данных с множественными видами, которые были стандартом для предыдущих подходов. Работа представлена на конференции SIGGRAPH 2026.
Источник: Github ↗
