Инструменты1 июля 2026 г., 01:45 МСК🤖 Auto

Face Anything: 4D-реконструкция лица за один проход с точностью 3x

TUM и Huawei Noah’s Ark Lab представили Face Anything — унифицированную модель на базе трансформеров, которая за один проход восстанавливает 4D-геометрию лица и выполняет плотное отслеживание, улучшив точность глубины на 16%.

Баннер новости 2648

Проблема неоднозначности и решение через каноническое пространство

Восстановление динамических лиц из видеопоследовательностей — сложная задача из-за одновременного изменения выражений, ракурсов и некогерентных деформаций. Традиционные методы часто требуют итеративной оптимизации или раздельного решения задач отслеживания и реконструкции. Команда исследователей из Технического университета Мюнхена (TUM) и Huawei Noah’s Ark Lab предложила Face Anything — feed-forward модель, которая решает обе задачи в едином архитектурном подходе.

Ключевая инновация заключается в предсказании канонических координат лица. Каждый пиксель изображения сопоставляется с нормализованной координатой в общем каноническом пространстве. Это трансформирует задачу плотного отслеживания в задачу канонической реконструкции, обеспечивая временную согласованность геометрии без явного оценивания движения между кадрами.

Архитектура и обучение

Модель построена на базе трансформера с головой типа DPT (Dense Prediction Transformer). Она принимает на вход одно или несколько изображений и за один проход генерирует:

  • Глубину (depth maps);
  • Канонические карты лица (canonical facial maps);
  • Ray maps для уточнения геометрии.

Обучение проходит в два этапа:

  1. Предобучение: на датасете DAViD для получения базовых знаний о лицевой геометрии.
  2. Дообучение (Fine-tuning): с использованием канонического надзора на собственном датасете, созданном на основе NeRSemble.

Создание датасета и метрики

Исследователи создали крупномасштабный датасет, используя синхронизированные многовидовые захваты. Геометрия восстанавливалась через COLMAP, а затем выравнивалась в каноническое пространство с помощью модели FLAME. Это позволило получить плотные карты соответствий для обучения.

Результаты тестирования на бенчмарках NeRSemble и VFHQ демонстрируют прорывные показатели. Face Anything превосходит существующие методы как по точности реконструкции, так и по скорости инференса.

Метрика / Метод Face Anything Примечание
Ошибка соответствия (Correspondence Error) ~3x ниже По сравнению с prior dynamic reconstruction methods
Точность глубины (Depth Accuracy) +16% Улучшение по сравнению с базовыми линиями
Скорость инференса Выше Благодаря feed-forward архитектуре (без итераций)
Сравнение с SOTA (Pixel3DMM, V-DPM) Превосходит По точности трекинга и fidelity реконструкции

Почему это важно

Face Anything устраняет разрыв между статической реконструкцией и динамическим трекингом. Использование канонических координат позволяет эффективно находить соответствия через nearest-neighbor search, что делает систему устойчивой к изменениям выражений и ракурсов. Код, модель и датасет будут опубликованы, что открывает возможности для применения в цифровых двойниках, телеприсутствии и создании контента.

Источник: Github ↗