Революция в анимации: один кадр вместо скелета
Viggle-Animate решает задачу контролируемой замены персонажа (character replacement) принципиально новым способом. В отличие от большинства современных решений, которые опираются на промежуточные представления — позы (skeletons), сегментационные маски или вырезанные лица — эта модель работает напрямую с пикселями.
Алгоритм не требует загрузки текстового энкодера, трекеров лиц или сегментаторов. Единственные входные данные — это исходное видео и один кадр из него, в котором пользователь вручную перерисовал персонажа. Поскольку референс является частью исходного клипа, поза, камера, освещение и тайминг уже совпадают, и модели не нужно выполнять сложную пост-выравнивание.
Техническая суть: 33.1B параметров и 3 прохода
Модель представляет собой полнофункциональную донастройку (full finetune) трансформера MiniMax-H3 (архитектура ref2va) с объемом параметров 33.1 млрд. Ключевая инновация — совместная дистилляция с использованием метода DMD (Distilled Model Distillation).
Процесс дистилляции разделен по уровням шума:
- Высокий шум: отвечает за саму замену персонажа (геометрию и позу).
- Низкий шум: отвечает за детализацию и текстуру изображения.
Благодаря LoRA-дельте (rank 128, 2.5 GB), процесс генерации сократился с типичных 20-30 шагов до всего 3 прямых проходов (forward passes). Это позволяет генерировать видео на одной GPU без необходимости оркестрации множества моделей.
Скорость и производительность
Сравнение проводилось на GPU NVIDIA B200 при разрешении 480×832 и 124 кадрах (24 fps). Viggle-Animate демонстрирует впечатляющий прирост скорости по сравнению с Wan2.2-Animate-14B, который является одним из лидеров в этой нише.
| Параметр | Viggle-Animate (33.1B) | Wan2.2-Animate-14B |
|---|---|---|
| Время рендера | 26 секунд | 160 секунд |
| Прямые проходы (passes) | 3 | 40 (20 шагов × 2 чанка) |
| Входные данные | Видео + 1 перерисованный кадр | Видео + фото персонажа + препроцессинг |
| Ускорение | 6.1× быстрее за клип (в 10.3 раза быстрее на этапе семплирования) | |
Универсальность: от людей до самолетов
Поскольку модель не обучалась на специфических «человеческих» скелетах, она способна анимировать любые объекты, которые пользователь может нарисовать. В демонстрациях показаны:
- Животные: перенос позы человека на животных с другими пропорциями (уши, хвосты, ласты).
- Нелюдоидные объекты: анимация самолета, где крылья привязаны к рукам, или робота с металлическим блеском.
- Стилизованные объекты: глиняные фигурки, сохраняющие стиль на протяжении всего клипа.
Ограничения и будущие планы
Несмотря на прогресс, у модели есть четкие границы применимости:
- Наследование артефактов: модель не может добавить то, чего нет в нарисованном кадре. Если в рисунке анатомия не совпадает с движением видео, видео «побеждает» (например, LEGO-фигурка может вернуть человеческую анатомию).
- Липсинк: синхронизация губ в крупных планах остается слабой из-за ограничений обучающих данных.
- Сложные сцены: несколько персонажей, тесное взаимодействие и резкие склейки пока снижают качество.
Команда уже работает над следующей версией, которая должна решить проблемы с липсинком и сложными сценами.
Источник: Huggingface ↗
