Релиз модели22 августа 2026 г., 13:47 МСК🤖 Auto

4DAnyone: Создание 4D-аватара из одного видео без калибровки

Исследователи из Zhejiang University и Ant Group представили 4DAnyone — метод генерации фотореалистичных 4D-аватаров из одного случайного монокулярного видео без использования спецоборудования.

Баннер новости 6303

Революция в доступности 4D-контента

Традиционная реконструкция 4D-человека требует сложных калиброванных массивов синхронизированных камер, что делает процесс недоступным для массового пользователя. Новая работа 4DAnyone (представлена на SIGGRAPH Asia 2026) решает эту проблему, позволяя создавать 4D-модели из одного «бытового» видео, снятого на смартфон. Система не требует штатива, калибровки камеры или знания её внутренних параметров (intrinsics).

Техническое ядро: RCP и TCR

Главная сложность задачи — обеспечение структурной согласованности при генерации множества видов. Обучение 4D Gaussian Splatting (4DGS) требует десятков ракурсов, но ограничения вычислений заставляют генерировать их группами, что приводит к дрейфу структуры. Авторы предлагают два ключевых решения:

  • Reference Context Packing (RCP): Сжимает линейно растущий контекст ссылок в фиксированный бюджет памяти.
  • Target Context Routing (TCR): Маршрутизирует контекст между разрозненными группами, обеспечивая кросс-групповую структурную коммуникацию.

Геометрическая точность через скелет

Вместо использования хрупких плотных глубинных карт (depth maps) и зашумленных параметров камеры, метод использует 3D-скелет человека. Этот скелет извлекается из исходного видео и служит надежным геометрическим ориентиром для генерации каждого целевого вида. Сгенерированные виды затем используются для обучения финальной модели 4DGS с помощью алгоритма FreeTimeGS.

Результаты и сравнения

Метод демонстрирует устойчивость к разнообразным условиям съемки (танцы, спорт, речь, мода). Ниже приведено сравнение подхода 4DAnyone с предыдущими состояниями искусства (SoTA) в контексте качества генерации и реконструкции:

Характеристика Традиционные методы 4DAnyone (2026)
Входные данные Массив синхронизированных камер Одно монокулярное видео (casual)
Требования к оборудованию Калибровка, штатив, rig Отсутствуют (anyone)
Геометрический conditioning Плотные depth-карты (шумные) 3D-скелет (точное руководство)
Результат Высокое качество, но сложно Фотореализм + 4DGS модель

Исследование показывает, что 4DAnyone превосходит предыдущие методы как по качеству видео с новых ракурсов, так и по качеству итоговой 4D-реконструкции, открывая путь к массовому созданию цифровых двойников людей.

Источник: Github ↗