Прорыв в анимации: от офлайна к стримингу
Лаборатория Tongyi (Alibaba Group) представила Wan-Animate-2 — новую архитектуру для анимации персонажей, которая решает сразу две критические проблемы индустрии: потерю идентичности лица и высокую вычислительную задержку. В отличие от предыдущих решений, требующих часов для рендеринга одного клипа, новая система способна работать в режиме реального времени (real-time streaming), что делает её пригодной для живых трансляций и интерактивных цифровых аватаров.
Архитектура: отказ от промежуточных извлекателей
Ключевое отличие Wan-Animate-2 — использование переосмысленного Diffusion Transformer (DiT), который напрямую обрабатывает видео-драйвер. Старые подходы страдали от двух недостатков: явные методы извлечения движения теряли детали, а неявные методы сжимали динамику. Wan-Animate-2 устраняет промежуточные извлекатели движения, используя два инновационных механизма:
- Time-Align RoPE: обеспечивает временное выравнивание между токенами видео и референсными токенами.
- Sparse-Ref Attention: позволяет модели выборочно фокусироваться на наиболее информативных признаках референса, сохраняя идентичность персонажа.
Уникальные возможности: мульти-камера и мульти-персоны
Система поддерживает сложные сценарии, недоступные конкурентам. В частности, внедрено текстовое управление камерой, которое отделяет перспективу вывода от движения видео-драйвера. Это позволяет наблюдать за анимацией с разных углов без потери согласованности. Также поддерживается анимация нескольких персонажей одновременно (single-to-multiple и multiple-to-multiple).
Wan-Animate-2-Lite: достижение real-time
Для достижения скорости, необходимой для интерактивных приложений, создана облегченная версия Wan-Animate-2-Lite. Она использует трехэтапный процесс обучения:
- Предобучка с teacher forcing и механизмом буфера ошибок.
- Дистилляция Self-Forcing.
- Обратное распространение ошибки (backpropagation) по чанкам (chunk-wise).
Это позволяет снизить задержку инференса до пороговых значений реального времени, обеспечивая синхронизацию движений и мимики с минимальным лагом.
Сравнение с состоянием искусства (SOTA)
В ходе качественных оценок и пользовательских исследований Wan-Animate-2 продемонстрировал превосходство в сохранении мелких деталей (fine-grained dynamics) и физической правдоподобности взаимодействий персонажа со сценой. Ниже приведена сводка ключевых характеристик новой модели:
| Характеристика | Wan-Animate-2 (Base) | Wan-Animate-2-Lite | Проблема предыдущих SOTA |
|---|---|---|---|
| Архитектура | End-to-end DiT | Optimized DiT (Distilled) | Зависимость от явных/неявных экстракторов движения |
| Идентичность | Высокая (без дрейфа) | Высокая | Identity drift при сжатии или извлечении |
| Управление камерой | Текстовое (decoupled) | Текстовое (decoupled) | Жесткая привязка к пространственным якорям драйвера |
| Режим работы | Offline / High Quality | Real-time Streaming | Невозможность интерактивного использования |
| Мульти-персоны | Да (Single-to-Multi) | Да | Ограничено одним персонажем |
Компания планирует опубликовать веса модели Wan-Animate-2-Base в открытом доступе, что должно стимулировать дальнейшие исследования в области генеративного видео.
Источник: Github ↗
