PKU-YuanGroup/Open-Sora-Plan

Этот проект направлен на воспроизведение Sora (модели Open AI T2V), мы надеемся, что сообщество open source внесет свой вклад в этот проект.

Видео⭐ 12 206Pythonпоследний релиз: v1.5.0
Открыть на GitHub ↗

Что это за инструмент

Open-Sora Plan — это open-source проект, направленный на воспроизведение модели генерации видео Sora от OpenAI, с акцентом на масштабируемость и использование сообщества.

Зачем нужен

Проект решает задачу создания высококачественных видео по текстовым или изображенческим промптам, предлагая альтернативу закрытым коммерческим решениям. Он полезен для исследователей и разработчиков, желающих экспериментировать с архитектурой видео-диффузии (DiT) и оптимизировать обучение на специфичном оборудовании, таком как Huawei Ascend.

Что можно реализовать

  • Генерация текстовых видео (Text-to-Video) с поддержкой длинных последовательностей и высокой частотой кадров.
  • Создание видео по изображению (Image-to-Video) и генерация переходов между кадрами.
  • Обучение и инференс моделей на ускорителях Huawei Ascend 910 (включая версию 1.5.0).
  • Исследование архитектуры Sparse DiT и высококомпрессионных видео-VAE (WFVAE) для снижения требований к VRAM.

Ключевые возможности

  • Версия 1.5.0 полностью обучена и работает на Huawei Ascend 910, используя 8B-модель и 40 млн видео-сэмплов.
  • Интеграция прорывной модели Helios для генерации минутных видео с качеством 19.5 FPS на одной GPU H100.
  • Поддержка 93x480p разрешения при использовании всего 24G VRAM благодаря стратегии bucket training и sparse attention.
  • Наличие рефинера промптов и стратегии фильтрации данных для улучшения качества генерации.
  • Открытая лицензия Apache и активное развитие сообщества с публикациями в arXiv.

👤 Кому подойдёт: Исследователи в области компьютерного зрения, алгоритмические инженеры, разработчики, работающие с видео-генерацией и специализированным железом (Huawei Ascend, NVIDIA H100).

Релизы

v1.5.0majorbreaking
🕐 15 мес назад · релиз на GitHub ↗

Релиз Open-Sora Plan v1.5.0: поддержка только NPU через mindspeed-mm, улучшенные WFVAE, sparse DiT и SUV модели.

  • Breaking: Поддержка ограничена только NPU с использованием фреймворка mindspeed-mm.
  • Added: Добавлен WFVAE с более высоким коэффициентом сжатия.
  • Added: Улучшены модели sparse DiT и SUV.
  • Added: Обеспечено полное обучение и инференс на базе NPU и mindspeed-mm.