Проблема неоднозначности и решение через каноническое пространство
Восстановление динамических лиц из видеопоследовательностей — сложная задача из-за одновременного изменения выражений, ракурсов и некогерентных деформаций. Традиционные методы часто требуют итеративной оптимизации или раздельного решения задач отслеживания и реконструкции. Команда исследователей из Технического университета Мюнхена (TUM) и Huawei Noah’s Ark Lab предложила Face Anything — feed-forward модель, которая решает обе задачи в едином архитектурном подходе.
Ключевая инновация заключается в предсказании канонических координат лица. Каждый пиксель изображения сопоставляется с нормализованной координатой в общем каноническом пространстве. Это трансформирует задачу плотного отслеживания в задачу канонической реконструкции, обеспечивая временную согласованность геометрии без явного оценивания движения между кадрами.
Архитектура и обучение
Модель построена на базе трансформера с головой типа DPT (Dense Prediction Transformer). Она принимает на вход одно или несколько изображений и за один проход генерирует:
- Глубину (depth maps);
- Канонические карты лица (canonical facial maps);
- Ray maps для уточнения геометрии.
Обучение проходит в два этапа:
- Предобучение: на датасете DAViD для получения базовых знаний о лицевой геометрии.
- Дообучение (Fine-tuning): с использованием канонического надзора на собственном датасете, созданном на основе NeRSemble.
Создание датасета и метрики
Исследователи создали крупномасштабный датасет, используя синхронизированные многовидовые захваты. Геометрия восстанавливалась через COLMAP, а затем выравнивалась в каноническое пространство с помощью модели FLAME. Это позволило получить плотные карты соответствий для обучения.
Результаты тестирования на бенчмарках NeRSemble и VFHQ демонстрируют прорывные показатели. Face Anything превосходит существующие методы как по точности реконструкции, так и по скорости инференса.
| Метрика / Метод | Face Anything | Примечание |
|---|---|---|
| Ошибка соответствия (Correspondence Error) | ~3x ниже | По сравнению с prior dynamic reconstruction methods |
| Точность глубины (Depth Accuracy) | +16% | Улучшение по сравнению с базовыми линиями |
| Скорость инференса | Выше | Благодаря feed-forward архитектуре (без итераций) |
| Сравнение с SOTA (Pixel3DMM, V-DPM) | Превосходит | По точности трекинга и fidelity реконструкции |
Почему это важно
Face Anything устраняет разрыв между статической реконструкцией и динамическим трекингом. Использование канонических координат позволяет эффективно находить соответствия через nearest-neighbor search, что делает систему устойчивой к изменениям выражений и ракурсов. Код, модель и датасет будут опубликованы, что открывает возможности для применения в цифровых двойниках, телеприсутствии и создании контента.
Источник: Github ↗
