Революция в доступности 4D-контента
Традиционная реконструкция 4D-человека требует сложных калиброванных массивов синхронизированных камер, что делает процесс недоступным для массового пользователя. Новая работа 4DAnyone (представлена на SIGGRAPH Asia 2026) решает эту проблему, позволяя создавать 4D-модели из одного «бытового» видео, снятого на смартфон. Система не требует штатива, калибровки камеры или знания её внутренних параметров (intrinsics).
Техническое ядро: RCP и TCR
Главная сложность задачи — обеспечение структурной согласованности при генерации множества видов. Обучение 4D Gaussian Splatting (4DGS) требует десятков ракурсов, но ограничения вычислений заставляют генерировать их группами, что приводит к дрейфу структуры. Авторы предлагают два ключевых решения:
- Reference Context Packing (RCP): Сжимает линейно растущий контекст ссылок в фиксированный бюджет памяти.
- Target Context Routing (TCR): Маршрутизирует контекст между разрозненными группами, обеспечивая кросс-групповую структурную коммуникацию.
Геометрическая точность через скелет
Вместо использования хрупких плотных глубинных карт (depth maps) и зашумленных параметров камеры, метод использует 3D-скелет человека. Этот скелет извлекается из исходного видео и служит надежным геометрическим ориентиром для генерации каждого целевого вида. Сгенерированные виды затем используются для обучения финальной модели 4DGS с помощью алгоритма FreeTimeGS.
Результаты и сравнения
Метод демонстрирует устойчивость к разнообразным условиям съемки (танцы, спорт, речь, мода). Ниже приведено сравнение подхода 4DAnyone с предыдущими состояниями искусства (SoTA) в контексте качества генерации и реконструкции:
| Характеристика | Традиционные методы | 4DAnyone (2026) |
|---|---|---|
| Входные данные | Массив синхронизированных камер | Одно монокулярное видео (casual) |
| Требования к оборудованию | Калибровка, штатив, rig | Отсутствуют (anyone) |
| Геометрический conditioning | Плотные depth-карты (шумные) | 3D-скелет (точное руководство) |
| Результат | Высокое качество, но сложно | Фотореализм + 4DGS модель |
Исследование показывает, что 4DAnyone превосходит предыдущие методы как по качеству видео с новых ракурсов, так и по качеству итоговой 4D-реконструкции, открывая путь к массовому созданию цифровых двойников людей.
Источник: Github ↗
