Релиз модели27 июля 2026 г., 01:46 МСК🤖 Auto

LiveAvatar: 45 FPS и бесконечное видео от Alibaba на модели 14B

Alibaba и USTC представили LiveAvatar — систему генерации аватаров в реальном времени. Модель на 14 млрд параметров обеспечивает 45 FPS на H800 и поддерживает потоковую генерацию видео любой длины.

Баннер новости 4438

Прорыв в скорости и длине генерации

Команда исследователей из Университета науки и технологий Китая, Alibaba Group и других институтов представила LiveAvatar — архитектуру, совместимую на уровне алгоритма и системы. Главная особенность решения: возможность генерации интерактивного видео с аватарами, управляемыми аудио, в режиме реального времени (streaming) и бесконечной продолжительности. Проект принят в качестве устного доклада (Oral) на конференцию ECCV 2026.

В основе лежит диффузионная модель с 14 миллиардами параметров (базовая модель Wan2.2-S2V-14B). Благодаря оптимизациям, таким как квантование FP8 и компиляция, система достигает стабильных 45 FPS при использовании 4 шагов сэмплирования. Это позволяет создавать непрерывные видео длительностью более 10 000 секунд (более 2,5 часов) без потери качества.

Технические характеристики и производительность

Разработчики достигли значительного ускорения по сравнению с предыдущими версиями. Версия 1.1, выпущенная в январе 2026 года, использует FP8-квантование, что позволяет запускать инференс даже на видеокартах с 48 ГБ видеопамяти, а также применяет cuDNN attention для ускорения вычислений. Ниже приведено сравнение ключевых метрик производительности:

r>
Параметр Значение / Характеристика Примечание
Архитектура модели 14B Diffusion Model (Wan2.2-S2V-14B + LoRA) Базовая модель + адаптация LiveAvatar
Скорость генерации 45+ FPS На мульти-GPU кластере (H800)
Длительность видео 10,000+ секунд Благодаря Block-wise Autoregressive processing
Шаги сэмплирования 4 шага Использование Distribution-matching distillation
Минимальное железо 48 GB VRAM (FP8) / 80 GB VRAM (стандарт) Поддержка single-GPU инференса (80GB)
Ускорение ~2.5x пиковая скорость Благодаря компиляции и cuDNN attention

Гибкость развертывания

LiveAvatar предлагает два режима работы, адаптированных под разные вычислительные мощности:

  • Мульти-GPU (Real-time Streaming): Требует кластер из 5 GPU (например, H800) для обеспечения максимальной скорости 45 FPS и потоковой генерации. Идеально для интерактивных диалогов с ИИ.
  • Single-GPU (Offline/Streaming): Запуск на одной видеокарте с 80 ГБ VRAM. Позволяет генерировать видео офлайн или с задержкой, что делает технологию доступнее для исследователей и энтузиастов без серверных кластеров.

Разработчики также анонсировали интеграцию VAE-компонента LightX2V, что в будущем позволит сократить потребность в 4 GPU для 4-шагового инференса.

Почему это важно

Ранее генерация видео с аватарами требовала либо длительной офлайн-обработки, либо страдала от низкой частоты кадров, что делало невозможным реальное интерактивное общение. LiveAvatar решает проблему «бесконечности» и «скорости» одновременно. Это открывает путь к созданию полноценных виртуальных собеседников, цифровых двойников для стриминга и образовательного контента, генерируемого в прямом эфире. Код модели и веса уже доступны на GitHub и Hugging Face под лицензией Apache 2.0.

Источник: Github ↗