huggingface/diffusers

🤗 Diffusers: передовые диффузионные модели для генерации изображений, видео и аудио на PyTorch.

Vision⭐ 34 554Pythonпоследний релиз: v0.40.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Diffusers — это библиотека Hugging Face для работы с современными диффузионными моделями, позволяющая генерировать изображения, видео и аудио.

Зачем нужен

Инструмент решает задачу создания, инференса и обучения диффузионных моделей, предлагая баланс между простотой использования и гибкостью настройки. Он полезен тем, кто хочет быстро запустить готовые модели или собрать собственную архитектуру из модульных компонентов.

Что можно реализовать

  • Генерация изображений по текстовому описанию (text-to-image) с использованием готовых пайплайнов
  • Создание кастомных систем диффузии путем комбинирования различных моделей и планировщиков шума (schedulers)
  • Генерация аудио и видео с помощью специализированных диффузионных моделей
  • Исследование и эксперименты с архитектурой моделей (например, UNet) для научных целей

Ключевые возможности

  • Готовые диффузионные пайплайны для быстрого инференса в несколько строк кода
  • Модульная архитектура: возможность заменять модели и планировщики шума (schedulers) независимо
  • Поддержка Apple Silicon (M1/M2) для оптимизации работы на Mac
  • Философия 'usability over performance' и 'simple over easy', упрощающая кастомизацию
  • Доступ к более чем 30 000 чекпоинтов на Hugging Face Hub

👤 Кому подойдёт: разработчики, исследователи, инженеры машинного обучения

Релизы

v0.40.0major
🕐 1 мес назад · релиз на GitHub ↗

Релиз Diffusers v0.40.0: новые модели LTX-2.5, Wan-Animate-2, MiniMax-H3, Stable Audio 3 и стабильная поддержка Modular Diffusers.

  • Added: Добавлены новые пайплайны: LTX-2.5, Wan-Animate-2, MiniMax-H3 (видео+аудио), MiniMax Music 3 и Stable Audio 3.
  • Added: Modular Diffusers выведены из экспериментальной фазы и теперь поддерживаются стабильно.
  • Added: Добавлена минимальная поддержка tensor-parallel для распределенных вычислений.
  • Added: В LTX-2.5 добавлена автогенерация длины видео через duration_head и улучшение промптов через Gemma-4.
v0.39.0minor
🕐 2 мес назад · релиз на GitHub ↗

В diffusers v0.39.0 добавлены новые модели: Cosmos 3, Ideogram 4, Krea 2, DreamLite, PRX Pixel и Motif-Video.

  • Added: Добавлен Cosmos 3 — унифицированная модель NVIDIA для генерации мира, физического моделирования и действий.
  • Added: Поддержка Ideogram 4 с flow-matching, асимметричным guidance и загрузкой LoRA.
  • Added: Добавлен Krea 2 (K2) — модель на базе MMDiT с поддержкой Qwen3-VL и дистиллированных чекпоинтов.
  • Added: Включен DreamLite от ByteDance для быстрого text-to-image и редактирования изображений на устройствах.
  • Added: Добавлен PRX Pixel от Photoroom — генерация в пиксельном пространстве без VAE.
  • Added: Подключен Motif-Video — диффузионный трансформер для text-to-video и image-to-video.
v0.38.0minor
🕐 4 мес назад · релиз на GitHub ↗

Добавлены новые модели (LLaDA2, Nucleus-MoE, Ernie-Image, Ace-Step 1.5), поддержка Flash Attention 4 и модульных пайплайнов.

  • Added: Добавлены пайплайны для LLaDA2, Nucleus-MoE, Ernie-Image, LongCat-AudioDiT и Ace-Step 1.5.
  • Added: Появилась поддержка декодера Flux.2 Small для ускорения генерации.
  • Added: Реализована модульная поддержка для LTX-2 и Hunyuan 1.5.
  • Added: В ядро библиотеки интегрирована бэкенд-поддержка Flash Attention 4.
  • Added: Добавлена поддержка FlashPack, группового оффлоадинга с TorchAO и профилирования пайплайнов.