Релиз модели8 августа 2026 г., 17:46 МСК🤖 Auto

Wan-Animate-2: Alibaba представила анимацию персонажей в реальном времени

Tongyi Lab из Alibaba представила Wan-Animate-2 — систему генерации видео, которая устраняет задержки и сохраняет идентичность персонажа, открывая путь к интерактивным цифровым аватарам.

Баннер новости 5375

Прорыв в анимации: от офлайна к стримингу

Лаборатория Tongyi (Alibaba Group) представила Wan-Animate-2 — новую архитектуру для анимации персонажей, которая решает сразу две критические проблемы индустрии: потерю идентичности лица и высокую вычислительную задержку. В отличие от предыдущих решений, требующих часов для рендеринга одного клипа, новая система способна работать в режиме реального времени (real-time streaming), что делает её пригодной для живых трансляций и интерактивных цифровых аватаров.

Архитектура: отказ от промежуточных извлекателей

Ключевое отличие Wan-Animate-2 — использование переосмысленного Diffusion Transformer (DiT), который напрямую обрабатывает видео-драйвер. Старые подходы страдали от двух недостатков: явные методы извлечения движения теряли детали, а неявные методы сжимали динамику. Wan-Animate-2 устраняет промежуточные извлекатели движения, используя два инновационных механизма:

  • Time-Align RoPE: обеспечивает временное выравнивание между токенами видео и референсными токенами.
  • Sparse-Ref Attention: позволяет модели выборочно фокусироваться на наиболее информативных признаках референса, сохраняя идентичность персонажа.

Уникальные возможности: мульти-камера и мульти-персоны

Система поддерживает сложные сценарии, недоступные конкурентам. В частности, внедрено текстовое управление камерой, которое отделяет перспективу вывода от движения видео-драйвера. Это позволяет наблюдать за анимацией с разных углов без потери согласованности. Также поддерживается анимация нескольких персонажей одновременно (single-to-multiple и multiple-to-multiple).

Wan-Animate-2-Lite: достижение real-time

Для достижения скорости, необходимой для интерактивных приложений, создана облегченная версия Wan-Animate-2-Lite. Она использует трехэтапный процесс обучения:

  1. Предобучка с teacher forcing и механизмом буфера ошибок.
  2. Дистилляция Self-Forcing.
  3. Обратное распространение ошибки (backpropagation) по чанкам (chunk-wise).

Это позволяет снизить задержку инференса до пороговых значений реального времени, обеспечивая синхронизацию движений и мимики с минимальным лагом.

Сравнение с состоянием искусства (SOTA)

В ходе качественных оценок и пользовательских исследований Wan-Animate-2 продемонстрировал превосходство в сохранении мелких деталей (fine-grained dynamics) и физической правдоподобности взаимодействий персонажа со сценой. Ниже приведена сводка ключевых характеристик новой модели:

Характеристика Wan-Animate-2 (Base) Wan-Animate-2-Lite Проблема предыдущих SOTA
Архитектура End-to-end DiT Optimized DiT (Distilled) Зависимость от явных/неявных экстракторов движения
Идентичность Высокая (без дрейфа) Высокая Identity drift при сжатии или извлечении
Управление камерой Текстовое (decoupled) Текстовое (decoupled) Жесткая привязка к пространственным якорям драйвера
Режим работы Offline / High Quality Real-time Streaming Невозможность интерактивного использования
Мульти-персоны Да (Single-to-Multi) Да Ограничено одним персонажем

Компания планирует опубликовать веса модели Wan-Animate-2-Base в открытом доступе, что должно стимулировать дальнейшие исследования в области генеративного видео.

Источник: Github ↗