Релиз модели21 июля 2026 г., 09:46 МСК🤖 Auto

StableAnimator: Анимация лиц без фейс-свапа. Принято в CVPR 2025

Фуданьский университет и Microsoft Research Asia представили StableAnimator — первую end-to-end модель, сохраняющую идентичность лица при анимации без постобработки.

Баннер новости 4016

Прорыв в сохранении идентичности (ID)

Модель StableAnimator, принятая в конференцию CVPR 2025, решает главную проблему генеративных видео: потерю узнаваемости лица при движении. В отличие от существующих решений, StableAnimator не требует использования сторонних инструментов для «наложения» лица (таких как FaceFusion) или восстановления деталей (GFP-GAN, CodeFormer). Анимация генерируется напрямую, обеспечивая высокую точность и сохранение индивидуальных черт.

Техническая архитектура

В основе лежит видео-диффузионная модель, дополненная специализированными модулями:

  • Face Encoder: Глобальный кодировщик, уточняющий эмбеддинги лица через взаимодействие с общим контентом изображения.
  • ID Adapter: Адаптер, aware к распределению данных, предотвращающий interference от временных слоев (temporal layers) и сохраняющий ID через выравнивание.
  • HJB Optimization: На этапе инференса применяется оптимизация на основе уравнения Гамильтона-Якоби-Беллмана. Это ограничивает путь денoising-процесса, что критически важно для качества лица.

Сравнение с SOTA

Эксперименты показывают превосходство StableAnimator над текущими моделями анимации человека. Ниже приведена сравнительная характеристика ключевых аспектов:

Характеристика StableAnimator (CVPR 2025) Традиционные подходы
Сохранение ID End-to-end (встроенное) Часто требует пост-процессинга
Постобработка лица Не требуется FaceFusion, CodeFormer, GFP-GAN
Разрешение (Basic) 576x1024 или 512x512 Зависит от модели
Оптимизация HJB-уравнение на этапе инференса Стандартный диффузионный шаг

Доступность и ресурсы

Код проекта уже доступен на GitHub. Разработчики выпустили:

  • Базовую версию модели (StableAnimator-basic) с поддержкой разрешений 576x1024 и 512x512.
  • Код для извлечения скелета (DWPose) и масок лица.
  • Инструкции по обучению и дообучению (fine-tuning) на собственных датасетах.

Для запуска требуется PyTorch 2.5.1 и CUDA 12.4. При нехватке памяти рекомендуется уменьшать количество анимируемых кадров. Весы модели загружаются через Hugging Face (доступен mirror для Китая).

Источник: Github ↗