nunchaku-ai/nunchaku

[ICLR2025 Spotlight] SVDQuant: Поглощение выбросов с помощью низкоранговых компонентов для 4-битных diffusion-моделей

Инференс⭐ 3 951Pythonпоследний релиз: v1.2.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Nunchaku — это высокопроизводительный движок инференса, оптимизированный для 4-битных нейронных сетей на основе метода SVDQuant.

Зачем нужен

Инструмент решает задачу эффективного запуска больших diffusion-моделей (например, FLUX, Qwen-Image) на видеокартах с ограниченным объемом VRAM за счет агрессивного квантования. Он позволяет снизить потребление памяти до 3 GiB без потери качества и поддерживает асинхронную выгрузку моделей в CPU.

Что можно реализовать

  • Запуск 4-битных моделей FLUX.1 (включая Krea-dev и Kontext) на потребительских GPU
  • Генерация и редактирование изображений с помощью 4-битных моделей Qwen-Image и их Lightning-версий
  • Использование LoRA-адаптеров в связке с ComfyUI через нативные узлы
  • Работа с ControlNet-Union-Pro 2.0 в условиях нехватки видеопамяти
  • Инференс на старых GPU (серия 20-series) с поддержкой INT4

Ключевые возможности

  • Метод SVDQuant (ICLR2025 Spotlight) для поглоления аутлайеров низкоранговыми компонентами
  • Снижение использования VRAM до 3 GiB благодаря асинхронному offloading в CPU
  • Поддержка ComfyUI с нативными узлами и интеграцией LoRA
  • Высокая производительность (20–30% прирост для Z-Image) и поддержка 4/8-step lightning-моделей
  • Наличие Python-бэкенда с модульными 4-битными линейными слоями

👤 Кому подойдёт: разработчики, исследователи и энтузиасты, работающие с diffusion-моделями и нуждающиеся в оптимизации инференса на GPU с ограниченным объемом памяти

Релизы

v1.2.1minor
🕐 7 мес назад · релиз на GitHub ↗

Обновление поддержки PyTorch 2.10 и расширенный набор версий CUDA, а также исправление сборки CI.

  • Added: Добавлена поддержка PyTorch 2.10 и расширен список совместимых версий CUDA.
  • Fixed: Исправлены проблемы в CI, связанные со сборкой проекта.
  • Добавлен бейдж трендовости в документацию.