Релиз модели6 августа 2026 г., 13:46 МСК🤖 Auto

JoyAI-Video-Edit: Редактирование видео в реальном времени на 16B модели

Команда JoyAI представила систему редактирования видео в реальном времени (30 FPS) на базе 16-миллиардной диффузионной модели, способную обрабатывать потоки без ожидания полной последовательности.

Баннер новости 5208

Прорыв в скорости: от офлайн-пакетов к стримингу

Лаборатория JoyAI выпустила JoyAI-Video-Edit — систему для редактирования видео на основе естественного языка в реальном времени. В отличие от традиционных методов, требующих загрузки всего видеофайла, эта модель обрабатывает кадры причинно-следственным образом (causally) по мере их поступления. Это позволяет редактировать живые трансляции или загруженные видео без предварительного знания длины ролика и без возврата к будущим кадрам.

Ключевая метрика производительности: система достигает 30.19 FPS (кадров в секунду) в полном конвейере (end-to-end) при разрешении 720x1280. Это переводит генеративное редактирование видео из категории офлайн-обработки в интерактивный стриминг.

Архитектура: 16B параметров и авторегрессионный подход

В основе системы лежит 16-миллиардная мультимодальная диффузионная трансформерная модель (MMDiT). Архитектура объединяет три ключевых компонента:

  • MLLM-кодировщик условий: интерпретирует текстовые инструкции.
  • Причинный видео-VAE: обрабатывает пространственно-временные данные без доступа к будущему.
  • Авторегрессионный диффузионный редактор: генерирует кадры последовательно.

Для минимизации накопления временных ошибок (temporal drift) и рассогласования обучения и инференса (train-inference mismatch) применены методы дистилляции распределений, оптимизации длинных горизонтов и bounded KV-state inference.

Возможности и бенчмарки

Модель поддерживает широкий спектр задач: изменение стиля, локальные правки объектов, замену фона, управление движением и редактирование по референс-изображениям. Ниже приведены результаты работы системы в различных сценариях:

Задача Пример инструкции (Prompt) Результат
Стилизация "Turn the video into a watercolor wash style" Видео преобразовано в акварельный стиль
Локальная правка "Make all dogs white, add colorful hats..." Собаки стали белыми, добавлены шляпы
Замена объектов "Remove the two white cats..." Кошки удалены из кадра
Глобальный стиль "...British castle aristocratic style" Интерьер и люди стилизованы под аристократов

Деплой и доступность

Код и веса модели (Apache 2.0) опубликованы на GitHub и Hugging Face. Для запуска требуется установка зависимостей через conda и скачивание чекпоинтов (MMDiT и VAE). Сервер запускается через скрипт run_server.sh и доступен по адресу http://localhost:8080.

В планах разработчиков — оптимизация для потребительских GPU (включая RTX 5090) и выпуск более мощной версии с улучшенным управлением по референсным изображениям (RV2V). Полные пайплайны обучения будут открыты позже.

Источник: Github ↗