OpenMOSS/MOVA
Фундаментальная модель, генерирующая синхронизированные видео и аудио в единой модели
Видео⭐ 1 117Python
Что это за инструмент
MOVA — это открытая фундаментальная модель для генерации видео и синхронизированного аудио в едином инференсе.
Зачем нужен
Инструмент решает задачу создания высококачественных видеороликов с точной синхронизацией губ (lip-sync) и звуковыми эффектами, избегая накопления ошибок, характерного для каскадных пайплайнов. Это полезно для создания реалистичных говорящих аватаров и контента с естественным звуковым сопровождением.
Что можно реализовать
- Генерация видео с речью одного человека с точным попаданием в губы (lip-sync)
- Создание сцен с несколькими говорящими персонажами
- Генерация видео с контекстно-зависимыми звуковыми эффектами (sound FX)
- Файн-тюнинг модели через LoRA для специфических стилей или задач
- Использование через API или ComfyUI для интеграции в рабочие процессы
Ключевые возможности
- Нативная бимодальная генерация видео и аудио в одном проходе инференса
- Асимметричная архитектура Dual-Tower с bidirectional cross-attention
- Полная открытость: веса, код инференса, обучения и скрипты LoRA
- State-of-the-art результаты в мультиязычной синхронизации губ
- Поддержка ComfyUI и доступность через API
👤 Кому подойдёт: разработчики, исследователи, создатели контента, интересующиеся open-source AI-генерацией мультимедиа
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.