thu-ml/TurboDiffusion
TurboDiffusion: ускорение видео-диффузионных моделей в 100–200 раз
Видео⭐ 3 761Python
Что это за инструмент
TurboDiffusion — это фреймворк ускорения видео-генерации на основе диффузионных моделей, обеспечивающий рост скорости в 100–200 раз за счет оптимизации внимания и дистилляции временных шагов.
Зачем нужен
Инструмент решает проблему низкой скорости генерации видео, позволяя создавать 5-секундные ролики за 1.9 секунды на одной RTX 5090, сохраняя при этом качество. Он полезен для разработчиков, которым требуется реальное время инференса или значительное снижение вычислительных затрат на генерацию контента.
Что можно реализовать
- Генерация коротких видео (до 5 секунд) в реальном времени на потребительских GPU (RTX 4090/5090)
- Быстрый инференс моделей Wan2.1 (T2V) и Wan2.2 (I2V) для прототипирования и тестирования
- Снижение затрат на inference за счет использования квантованных чекпоинтов и оптимизированных ядер SageAttention
- Генерация видео по тексту (Text-to-Video) и по изображению (Image-to-Video) с высокой скоростью
Ключевые возможности
- Ускорение end-to-end генерации в 100–200 раз по сравнению с оригинальными моделями
- Использование SageAttention и SLA (Sparse-Linear Attention) для ускорения вычислений внимания
- Применение rCM (rectified Coupled Maps) для дистилляции временных шагов, что позволяет сократить число шагов сэмплинга до 1–4
- Поддержка моделей Wan2.1 (1.3B, 14B) и Wan2.2 (14B) с разрешением 480p и 720p
- Наличие квантованных и не-квантованных чекпоинтов для разных типов GPU (RTX 5090/4090 vs H100)
👤 Кому подойдёт: ML-инженеры, разработчики AI-приложений, исследователи в области генеративного видео, оптимизирующие инференс на GPU
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.