PKU-YuanGroup/ConsisID
[CVPR 2025 Highlight🔥] Генерация видео из текста с сохранением идентичности путем частотной декомпозиции
Видео⭐ 857Python
Что это за инструмент
ConsisID — это модель генерации видео из текста (Text-to-Video) на базе DiT, которая сохраняет идентичность человека без необходимости дообучения (tuning-free).
Зачем нужен
Инструмент решает проблему потери узнаваемости персонажа при генерации видео, используя частотную декомпозицию для контроля идентичности. Это полезно для создателей контента, которым нужно генерировать видео с конкретными людьми, не тратя ресурсы на адаптацию базовых моделей.
Что можно реализовать
- Генерация видео с сохранением лица конкретного человека по текстовому запросу
- Создание анимаций или рекламных роликов с участием реальных людей
- Исследование методов частотного анализа в Vision/Diffusion Transformers
- Быстрое прототипирование видео-контента без этапа fine-tuning
Ключевые возможности
- Tuning-free подход: не требует дообучения модели под конкретного персонажа
- Основана на архитектуре DiT (Diffusion Transformer)
- Использует частотную декомпозицию для сохранения идентичности
- Официальная реализация статьи CVPR 2025 Highlight
- Открытый код и доступные веса на GitHub
👤 Кому подойдёт: разработчики, исследователи в области компьютерного зрения, создатели AI-контента
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.