Релиз модели5 сентября 2026 г., 11:46 МСК🤖 Auto

Viggle-Animate: 33B-модель для замены персонажей без скелетов и масок

Команда Viggle представила Viggle-Animate — модель на базе MiniMax-H3, которая заменяет персонажа в видео по одной нарисованной кадру. Система работает в 6 раз быстрее аналогов, не использует pose-эстиматоры и справляется со сложными движениями.

Баннер новости 6841

Революция в анимации: один кадр вместо скелета

Viggle-Animate решает задачу контролируемой замены персонажа (character replacement) принципиально новым способом. В отличие от большинства современных решений, которые опираются на промежуточные представления — позы (skeletons), сегментационные маски или вырезанные лица — эта модель работает напрямую с пикселями.

Алгоритм не требует загрузки текстового энкодера, трекеров лиц или сегментаторов. Единственные входные данные — это исходное видео и один кадр из него, в котором пользователь вручную перерисовал персонажа. Поскольку референс является частью исходного клипа, поза, камера, освещение и тайминг уже совпадают, и модели не нужно выполнять сложную пост-выравнивание.

Техническая суть: 33.1B параметров и 3 прохода

Модель представляет собой полнофункциональную донастройку (full finetune) трансформера MiniMax-H3 (архитектура ref2va) с объемом параметров 33.1 млрд. Ключевая инновация — совместная дистилляция с использованием метода DMD (Distilled Model Distillation).

Процесс дистилляции разделен по уровням шума:

  • Высокий шум: отвечает за саму замену персонажа (геометрию и позу).
  • Низкий шум: отвечает за детализацию и текстуру изображения.

Благодаря LoRA-дельте (rank 128, 2.5 GB), процесс генерации сократился с типичных 20-30 шагов до всего 3 прямых проходов (forward passes). Это позволяет генерировать видео на одной GPU без необходимости оркестрации множества моделей.

Скорость и производительность

Сравнение проводилось на GPU NVIDIA B200 при разрешении 480×832 и 124 кадрах (24 fps). Viggle-Animate демонстрирует впечатляющий прирост скорости по сравнению с Wan2.2-Animate-14B, который является одним из лидеров в этой нише.

Параметр Viggle-Animate (33.1B) Wan2.2-Animate-14B
Время рендера 26 секунд 160 секунд
Прямые проходы (passes) 3 40 (20 шагов × 2 чанка)
Входные данные Видео + 1 перерисованный кадр Видео + фото персонажа + препроцессинг
Ускорение 6.1× быстрее за клип (в 10.3 раза быстрее на этапе семплирования)

Универсальность: от людей до самолетов

Поскольку модель не обучалась на специфических «человеческих» скелетах, она способна анимировать любые объекты, которые пользователь может нарисовать. В демонстрациях показаны:

  • Животные: перенос позы человека на животных с другими пропорциями (уши, хвосты, ласты).
  • Нелюдоидные объекты: анимация самолета, где крылья привязаны к рукам, или робота с металлическим блеском.
  • Стилизованные объекты: глиняные фигурки, сохраняющие стиль на протяжении всего клипа.

Ограничения и будущие планы

Несмотря на прогресс, у модели есть четкие границы применимости:

  1. Наследование артефактов: модель не может добавить то, чего нет в нарисованном кадре. Если в рисунке анатомия не совпадает с движением видео, видео «побеждает» (например, LEGO-фигурка может вернуть человеческую анатомию).
  2. Липсинк: синхронизация губ в крупных планах остается слабой из-за ограничений обучающих данных.
  3. Сложные сцены: несколько персонажей, тесное взаимодействие и резкие склейки пока снижают качество.

Команда уже работает над следующей версией, которая должна решить проблемы с липсинком и сложными сценами.

Источник: Huggingface ↗