kandinskylab/kandinsky-5
Kandinsky 5.0: семейство diffusion-моделей для генерации видео и изображений
Видео⭐ 827Python
Что это за инструмент
Kandinsky 5.0 — семейство диффузионных моделей для генерации изображений и видео по текстовым и визуальным промптам.
Зачем нужен
Инструмент решает задачу создания высококачественного контента (HD-видео и изображения) с поддержкой контроля камеры и редактирования. Он полезен благодаря открытости моделей, наличию Lite-версий для экономии ресурсов и интеграции с экосистемой Hugging Face Diffusers.
Что можно реализовать
- Генерация HD-видео (5-10 секунд) из текста с контролируемым движением камеры
- Создание видео по исходному изображению и текстовому описанию (Image-to-Video)
- Быстрая генерация изображений с использованием оптимизированной Lite-модели
- Редактирование существующих изображений с помощью специализированных моделей
- Обучение LoRA-моделей для кастомизации стиля или контроля камеры
Ключевые возможности
- Рейтинг Top-1 среди open-source Text-to-Video моделей в LMArena (версия Video Pro)
- Наличие Lite-версий (2B параметров), работающих на GPU с 12 ГБ памяти
- Поддержка оптимизаций: Flash Attention 2, Sage Attention, VAE tiling и NF4
- Готовая интеграция с Hugging Face Diffusers и ComfyUI
- Открытые веса для SFT, Pretrain и дистиллированных моделей (16 шагов)
👤 Кому подойдёт: разработчики, исследователи, создатели контента
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.