kandinskylab/kandinsky-5

Kandinsky 5.0: семейство diffusion-моделей для генерации видео и изображений

Видео⭐ 827Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Kandinsky 5.0 — семейство диффузионных моделей для генерации изображений и видео по текстовым и визуальным промптам.

Зачем нужен

Инструмент решает задачу создания высококачественного контента (HD-видео и изображения) с поддержкой контроля камеры и редактирования. Он полезен благодаря открытости моделей, наличию Lite-версий для экономии ресурсов и интеграции с экосистемой Hugging Face Diffusers.

Что можно реализовать

  • Генерация HD-видео (5-10 секунд) из текста с контролируемым движением камеры
  • Создание видео по исходному изображению и текстовому описанию (Image-to-Video)
  • Быстрая генерация изображений с использованием оптимизированной Lite-модели
  • Редактирование существующих изображений с помощью специализированных моделей
  • Обучение LoRA-моделей для кастомизации стиля или контроля камеры

Ключевые возможности

  • Рейтинг Top-1 среди open-source Text-to-Video моделей в LMArena (версия Video Pro)
  • Наличие Lite-версий (2B параметров), работающих на GPU с 12 ГБ памяти
  • Поддержка оптимизаций: Flash Attention 2, Sage Attention, VAE tiling и NF4
  • Готовая интеграция с Hugging Face Diffusers и ComfyUI
  • Открытые веса для SFT, Pretrain и дистиллированных моделей (16 шагов)

👤 Кому подойдёт: разработчики, исследователи, создатели контента

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.