adobe-research/custom-diffusion

Custom Diffusion: кастомизация нескольких концепций для текстово-изображенийной диффузии (CVPR 2023)

Vision⭐ 1 977Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Custom Diffusion — метод быстрой донастройки текстовых диффузионных моделей (например, Stable Diffusion) для генерации изображений с новыми объектами или стилями на основе всего 4-20 примеров.

Зачем нужен

Инструмент решает задачу мульти-концептуальной кастомизации, позволяя обучать модель новым понятиям (объектам, стилям) без полной переобучки всей нейросети. Это полезно для создания персонализированных генераций с минимальными вычислительными затратами и небольшим объемом данных.

Что можно реализовать

  • Генерация изображений с конкретным новым объектом (например, игрушкой или питомцем) в различных контекстах
  • Применение уникального художественного стиля к стандартным сценариям генерации
  • Создание изображений, сочетающих несколько новых концепций (например, новый объект + новый стиль)
  • Быстрое прототипирование визуальных идей с использованием референсных фотографий

Ключевые возможности

  • Высокая скорость обучения: около 6 минут на 2 GPU A100
  • Экономия памяти: дообучение только ключевых и значимых проекций в слоях cross-attention, размер весов ~75 МБ на концепт
  • Поддержка мульти-концептуальной генерации (комбинация объектов, стилей и категорий)
  • Использование регуляризации на основе реальных изображений для предотвращения переобучения
  • Интеграция с библиотекой diffusers и поддержка SDXL

👤 Кому подойдёт: исследователи, разработчики AI, специалисты по компьютерному зрению

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.