Конец эры LBS: новый подход к анимации
Создание фотореалистичных 3D-аватаров из монокулярных изображений долгое время опиралось на Linear Blend Skinning (LBS) и параметрические модели тела. Этот подход ограничивал выразительность и часто приводил к артефактам из-за неточной подгонки. Команда из Codec Avatars Lab (Meta) и HKUST представила LUNA (Learning Universal 3D Human Animation Beyond Skinning) — универсальную нейросетевую модель, которая обходит этап явной подгонки тела.
LUNA напрямую отображает разнообразные 2D-контролы (изображения, ключевые точки, эскизы) в деформации 3D-гауссовых примитивов. Это позволяет создавать анимацию «из воздуха» для невиданных ранее персонажей с высокой точностью.
Техническое ядро: Transformer и гибридное обучение
В основе архитектуры лежит Transformer-based motion regressor, который разделяет глобальное жесткое движение и тонкие локальные динамики. Это обеспечивает как согласованность движений тела, так и реализм нежестких эффектов (например, движения одежды или мышц).
Для решения проблемы неоднозначности при переходе от 2D к 3D и масштабирования за пределы датасетов с разметкой, авторы внедрили гибридное обучение:
- Дистилляция знаний: использование LBS-учителя для передачи мягких структурных приоритетов.
- Гибкие потери: возможность обучения как на ограниченных данных с подгонкой, так и на больших наборах видео «в дикой природе» (in-the-wild) без разметки.
Универсальность входных данных
LUNA является первой end-to-end моделью, поддерживающей неявное управление 2D-сигналами. Модель способна обрабатывать различные модальности драйвинга:
- RGB-видео (полноценные кадры).
- Ключевые точки (keypoints).
- Эскизы (sketches).
Результаты и сравнение
Эксперименты показывают, что LUNA достигает визуальной точности, сопоставимой с методами на базе LBS, но превосходит их в генерации реалистичных движений и способности к zero-shot кросс-идентичностной генерации. Ниже приведено сравнение ключевых характеристик:
| Характеристика | LBS-подходы (базовые) | LUNA (предлагаемая модель) |
|---|---|---|
| Метод анимации | Linear Blend Skinning | 3D Gaussian Deformations (без LBS) |
| Входные данные | Только 3D-контролы / жесты | RGB, ключевые точки, эскизы, 2D-видео |
| Кросс-идентичность | Требует подгонки под новый персонаж | Zero-shot генерация для новых персонажей |
| Артефакты | Частые при плохой подгонке | Минимизированы за счет нейросетевого подхода |
| Обучение | Только на размеченных данных | Гибридное: размеченные + in-the-wild видео |
Работа представлена на конференции ECCV 2026 и доступна на arXiv. Код и демо-материалы опубликованы на GitHub.
Источник: Github ↗
