CompVis/latent-diffusion

Синтез изображений высокого разрешения с помощью латентных диффузионных моделей

Vision⭐ 14 152Jupyter Notebook
Открыть на GitHub ↗

Что это за инструмент

Реализация моделей латентного диффузии (Latent Diffusion Models) для высококачественной генерации изображений с использованием текстовых подсказок.

Зачем нужен

Инструмент решает задачу синтеза изображений высокого разрешения, предлагая более эффективный подход по сравнению с прямым диффузионным моделированием в пиксельном пространстве. Он полезен для создания генеративных моделей, поддерживающих как текстовую, так и визуальную условную генерацию, а также интеграцию с внешними базами данных изображений.

Что можно реализовать

  • Генерация изображений по текстовому описанию (text-to-image) с использованием предварительно обученных моделей на базе LAION.
  • Класс-условная генерация изображений (например, на датасете ImageNet) с применением guidance.
  • Синтез изображений с использованием retrieval-augmented diffusion (RDM), где генерация дополняется поиском похожих изображений через CLIP-эмбеддинги.
  • Исследование архитектуры диффузионных моделей и их модификаций (например, использование PLMS sampler для ускорения инференса).

Ключевые возможности

  • Поддержка retrieval-augmented diffusion моделей (RDM) для интеграции с базами знаний (Openimages, ArtBench).
  • Наличие предварительно обученных весов, включая крупную модель на 1.45B параметров.
  • Оптимизации инференса: ускорение classifier-free guidance в ~2 раза и доступность PLMS sampler.
  • Готовая интеграция с Huggingface Spaces и Gradio для быстрого запуска веб-демо.
  • Поддержка различных режимов условной генерации: только текст, текст с поиском соседей (k-nearest neighbors).

👤 Кому подойдёт: Исследователи в области компьютерного зрения, разработчики, работающие с генеративными моделями, ML-инженеры, интересующиеся архитектурой diffusion models.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.