Инструменты17 июля 2026 г., 19:17 МСК🤖 Auto

NVIDIA и Hugging Face объединили усилия для масштабного обучения Diffusers-моделей

NVIDIA NeMo Automodel теперь поддерживает прямое fine-tuning популярных моделей от Hugging Face без конвертации чекпоинтов. Поддержка FLUX, Wan 2.1 и HunyuanVideo уже доступна.

Баннер новости 3830

Прямая интеграция без конвертации весов

NVIDIA и Hugging Face анонсировали интеграцию библиотеки NVIDIA NeMo Automodel с экосистемой Diffusers. Ключевое преимущество решения — возможность запуска распределенного обучения (fine-tuning) любых моделей формата Diffusers напрямую с Hugging Face Hub. Разработчикам больше не нужно конвертировать веса в специфичный формат NVIDIA, а затем обратно для инференса. Чекпоинты сохраняют совместимость с DiffusionPipeline, инструментами квантования и LoRA-адаптерами.

Поддерживаемые модели и параметры

Решение поддерживает как full fine-tuning, так и параметрически эффективное обучение (LoRA). Ниже приведены основные модели, для которых уже готовы рецепты обучения:

Модель Hugging Face ID Задача Параметры LoRA
Wan 2.1 T2V 1.3B Wan-AI/Wan2.1-T2V-1.3B-Diffusers Text-to-Video 1.3B Да
Wan 2.1 T2V 14B Wan-AI/Wan2.1-T2V-14B-Diffusers Text-to-Video 14B Да
Wan 2.2 T2V A14B Wan-AI/Wan2.2-T2V-A14B-Diffusers Text-to-Video 27B (MoE), 14B active Нет
FLUX.1-dev black-forest-labs/FLUX.1-dev Text-to-Image 12B Да
FLUX.2-dev black-forest-labs/FLUX.2-dev Text-to-Image 32B Да
HunyuanVideo 1.5 hunyuanvideo-community/HunyuanVideo-1.5-Diffusers-720p_t2v Text-to-Video 13B Да
Qwen-Image Qwen/Qwen-Image Text-to-Image 20B (MMDiT) Да

Технические особенности и масштабирование

NeMo Automodel использует flow-matching как цель обучения и оптимизирован для работы с латентным пространством (pre-encoded VAE outputs). Библиотека позволяет гибко настраивать параллелизм через YAML-конфигурации без переписывания кода модели. Поддерживаются следующие схемы:

  • FSDP2 (Fully Sharded Data Parallel 2)
  • Tensor Parallel
  • Expert Parallel
  • Context Parallel
  • Pipeline Parallel

Также реализована многоуровневая bucketed dataloading для ускорения throughput при обучении на разных разрешениях.

Пример рабочего процесса

В качестве демонстрации NVIDIA показала fine-tuning модели FLUX.1-dev (12B параметров) на датасете из 78 карт Таро Rider-Waite. Обучение проводилось на кластере из 8 GPU A100 (40GB) с использованием 8-way FSDP2. Эффективный размер батча составил 32. Процесс включает предварительное кодирование датасета (pre-encoding) для кэширования латентов и запуск обучения через существующие YAML-конфигурации с командными переопределениями.

Доступность

Интеграция полностью открыта под лицензией Apache 2.0. Документация и примеры доступны в репозитории Hugging Face Diffusers. Для установки рекомендуется использовать Docker-образ nvcr.io/nvidia/nemo-automodel:26.06 или установку через pip.

Источник: Hugging Face blog ↗