PKU-YuanGroup/ConsisID

[CVPR 2025 Highlight🔥] Генерация видео из текста с сохранением идентичности путем частотной декомпозиции

Видео⭐ 857Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

ConsisID — это модель генерации видео из текста (Text-to-Video) на базе DiT, которая сохраняет идентичность человека без необходимости дообучения (tuning-free).

Зачем нужен

Инструмент решает проблему потери узнаваемости персонажа при генерации видео, используя частотную декомпозицию для контроля идентичности. Это полезно для создателей контента, которым нужно генерировать видео с конкретными людьми, не тратя ресурсы на адаптацию базовых моделей.

Что можно реализовать

  • Генерация видео с сохранением лица конкретного человека по текстовому запросу
  • Создание анимаций или рекламных роликов с участием реальных людей
  • Исследование методов частотного анализа в Vision/Diffusion Transformers
  • Быстрое прототипирование видео-контента без этапа fine-tuning

Ключевые возможности

  • Tuning-free подход: не требует дообучения модели под конкретного персонажа
  • Основана на архитектуре DiT (Diffusion Transformer)
  • Использует частотную декомпозицию для сохранения идентичности
  • Официальная реализация статьи CVPR 2025 Highlight
  • Открытый код и доступные веса на GitHub

👤 Кому подойдёт: разработчики, исследователи в области компьютерного зрения, создатели AI-контента

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.