Релиз модели1 июля 2026 г., 15:46 МСК🤖 Auto

LUNA: революция в 3D-анимации без скелетной анимации

Исследователи из Meta и HKUST представили LUNA — первую модель, создающую фотореалистичных 3D-аватаров напрямую из 2D-сигналов, полностью отказавшись от Linear Blend Skinning.

Баннер новости 2737

Конец эры LBS: новый подход к анимации

Создание фотореалистичных 3D-аватаров из монокулярных изображений долгое время опиралось на Linear Blend Skinning (LBS) и параметрические модели тела. Этот подход ограничивал выразительность и часто приводил к артефактам из-за неточной подгонки. Команда из Codec Avatars Lab (Meta) и HKUST представила LUNA (Learning Universal 3D Human Animation Beyond Skinning) — универсальную нейросетевую модель, которая обходит этап явной подгонки тела.

LUNA напрямую отображает разнообразные 2D-контролы (изображения, ключевые точки, эскизы) в деформации 3D-гауссовых примитивов. Это позволяет создавать анимацию «из воздуха» для невиданных ранее персонажей с высокой точностью.

Техническое ядро: Transformer и гибридное обучение

В основе архитектуры лежит Transformer-based motion regressor, который разделяет глобальное жесткое движение и тонкие локальные динамики. Это обеспечивает как согласованность движений тела, так и реализм нежестких эффектов (например, движения одежды или мышц).

Для решения проблемы неоднозначности при переходе от 2D к 3D и масштабирования за пределы датасетов с разметкой, авторы внедрили гибридное обучение:

  • Дистилляция знаний: использование LBS-учителя для передачи мягких структурных приоритетов.
  • Гибкие потери: возможность обучения как на ограниченных данных с подгонкой, так и на больших наборах видео «в дикой природе» (in-the-wild) без разметки.

Универсальность входных данных

LUNA является первой end-to-end моделью, поддерживающей неявное управление 2D-сигналами. Модель способна обрабатывать различные модальности драйвинга:

  • RGB-видео (полноценные кадры).
  • Ключевые точки (keypoints).
  • Эскизы (sketches).

Результаты и сравнение

Эксперименты показывают, что LUNA достигает визуальной точности, сопоставимой с методами на базе LBS, но превосходит их в генерации реалистичных движений и способности к zero-shot кросс-идентичностной генерации. Ниже приведено сравнение ключевых характеристик:

Характеристика LBS-подходы (базовые) LUNA (предлагаемая модель)
Метод анимации Linear Blend Skinning 3D Gaussian Deformations (без LBS)
Входные данные Только 3D-контролы / жесты RGB, ключевые точки, эскизы, 2D-видео
Кросс-идентичность Требует подгонки под новый персонаж Zero-shot генерация для новых персонажей
Артефакты Частые при плохой подгонке Минимизированы за счет нейросетевого подхода
Обучение Только на размеченных данных Гибридное: размеченные + in-the-wild видео

Работа представлена на конференции ECCV 2026 и доступна на arXiv. Код и демо-материалы опубликованы на GitHub.

Источник: Github ↗