CompVis/latent-diffusion
Синтез изображений высокого разрешения с помощью латентных диффузионных моделей
Vision⭐ 14 152Jupyter Notebook
Что это за инструмент
Реализация моделей латентного диффузии (Latent Diffusion Models) для высококачественной генерации изображений с использованием текстовых подсказок.
Зачем нужен
Инструмент решает задачу синтеза изображений высокого разрешения, предлагая более эффективный подход по сравнению с прямым диффузионным моделированием в пиксельном пространстве. Он полезен для создания генеративных моделей, поддерживающих как текстовую, так и визуальную условную генерацию, а также интеграцию с внешними базами данных изображений.
Что можно реализовать
- Генерация изображений по текстовому описанию (text-to-image) с использованием предварительно обученных моделей на базе LAION.
- Класс-условная генерация изображений (например, на датасете ImageNet) с применением guidance.
- Синтез изображений с использованием retrieval-augmented diffusion (RDM), где генерация дополняется поиском похожих изображений через CLIP-эмбеддинги.
- Исследование архитектуры диффузионных моделей и их модификаций (например, использование PLMS sampler для ускорения инференса).
Ключевые возможности
- Поддержка retrieval-augmented diffusion моделей (RDM) для интеграции с базами знаний (Openimages, ArtBench).
- Наличие предварительно обученных весов, включая крупную модель на 1.45B параметров.
- Оптимизации инференса: ускорение classifier-free guidance в ~2 раза и доступность PLMS sampler.
- Готовая интеграция с Huggingface Spaces и Gradio для быстрого запуска веб-демо.
- Поддержка различных режимов условной генерации: только текст, текст с поиском соседей (k-nearest neighbors).
👤 Кому подойдёт: Исследователи в области компьютерного зрения, разработчики, работающие с генеративными моделями, ML-инженеры, интересующиеся архитектурой diffusion models.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.