Прямая интеграция без конвертации весов
NVIDIA и Hugging Face анонсировали интеграцию библиотеки NVIDIA NeMo Automodel с экосистемой Diffusers. Ключевое преимущество решения — возможность запуска распределенного обучения (fine-tuning) любых моделей формата Diffusers напрямую с Hugging Face Hub. Разработчикам больше не нужно конвертировать веса в специфичный формат NVIDIA, а затем обратно для инференса. Чекпоинты сохраняют совместимость с DiffusionPipeline, инструментами квантования и LoRA-адаптерами.
Поддерживаемые модели и параметры
Решение поддерживает как full fine-tuning, так и параметрически эффективное обучение (LoRA). Ниже приведены основные модели, для которых уже готовы рецепты обучения:
| Модель | Hugging Face ID | Задача | Параметры | LoRA |
|---|---|---|---|---|
| Wan 2.1 T2V 1.3B | Wan-AI/Wan2.1-T2V-1.3B-Diffusers | Text-to-Video | 1.3B | Да |
| Wan 2.1 T2V 14B | Wan-AI/Wan2.1-T2V-14B-Diffusers | Text-to-Video | 14B | Да |
| Wan 2.2 T2V A14B | Wan-AI/Wan2.2-T2V-A14B-Diffusers | Text-to-Video | 27B (MoE), 14B active | Нет |
| FLUX.1-dev | black-forest-labs/FLUX.1-dev | Text-to-Image | 12B | Да |
| FLUX.2-dev | black-forest-labs/FLUX.2-dev | Text-to-Image | 32B | Да |
| HunyuanVideo 1.5 | hunyuanvideo-community/HunyuanVideo-1.5-Diffusers-720p_t2v | Text-to-Video | 13B | Да |
| Qwen-Image | Qwen/Qwen-Image | Text-to-Image | 20B (MMDiT) | Да |
Технические особенности и масштабирование
NeMo Automodel использует flow-matching как цель обучения и оптимизирован для работы с латентным пространством (pre-encoded VAE outputs). Библиотека позволяет гибко настраивать параллелизм через YAML-конфигурации без переписывания кода модели. Поддерживаются следующие схемы:
- FSDP2 (Fully Sharded Data Parallel 2)
- Tensor Parallel
- Expert Parallel
- Context Parallel
- Pipeline Parallel
Также реализована многоуровневая bucketed dataloading для ускорения throughput при обучении на разных разрешениях.
Пример рабочего процесса
В качестве демонстрации NVIDIA показала fine-tuning модели FLUX.1-dev (12B параметров) на датасете из 78 карт Таро Rider-Waite. Обучение проводилось на кластере из 8 GPU A100 (40GB) с использованием 8-way FSDP2. Эффективный размер батча составил 32. Процесс включает предварительное кодирование датасета (pre-encoding) для кэширования латентов и запуск обучения через существующие YAML-конфигурации с командными переопределениями.
Доступность
Интеграция полностью открыта под лицензией Apache 2.0. Документация и примеры доступны в репозитории Hugging Face Diffusers. Для установки рекомендуется использовать Docker-образ nvcr.io/nvidia/nemo-automodel:26.06 или установку через pip.
Источник: Hugging Face blog ↗
