OpenMOSS/MOVA

Фундаментальная модель, генерирующая синхронизированные видео и аудио в единой модели

Видео⭐ 1 117Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

MOVA — это открытая фундаментальная модель для генерации видео и синхронизированного аудио в едином инференсе.

Зачем нужен

Инструмент решает задачу создания высококачественных видеороликов с точной синхронизацией губ (lip-sync) и звуковыми эффектами, избегая накопления ошибок, характерного для каскадных пайплайнов. Это полезно для создания реалистичных говорящих аватаров и контента с естественным звуковым сопровождением.

Что можно реализовать

  • Генерация видео с речью одного человека с точным попаданием в губы (lip-sync)
  • Создание сцен с несколькими говорящими персонажами
  • Генерация видео с контекстно-зависимыми звуковыми эффектами (sound FX)
  • Файн-тюнинг модели через LoRA для специфических стилей или задач
  • Использование через API или ComfyUI для интеграции в рабочие процессы

Ключевые возможности

  • Нативная бимодальная генерация видео и аудио в одном проходе инференса
  • Асимметричная архитектура Dual-Tower с bidirectional cross-attention
  • Полная открытость: веса, код инференса, обучения и скрипты LoRA
  • State-of-the-art результаты в мультиязычной синхронизации губ
  • Поддержка ComfyUI и доступность через API

👤 Кому подойдёт: разработчики, исследователи, создатели контента, интересующиеся open-source AI-генерацией мультимедиа

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.