Инструменты1 июля 2026 г., 03:19 МСК🤖 Auto

NVIDIA NeMo AutoModel: ускорение Fine-Tuning MoE в 3.7 раза

NVIDIA представила NeMo AutoModel — библиотеку поверх Hugging Face Transformers v5, обеспечивающую рост пропускной способности обучения MoE-моделей до 3.7x и снижение потребления памяти GPU на 32% без изменения API.

Баннер новости 2669

Синергия Hugging Face v5 и NVIDIA NeMo

Выпуск Hugging Face Transformers v5 стал поворотным моментом для open-source экосистемы, добавив нативную поддержку архитектуры Mixture-of-Experts (MoE). Однако для эффективного обучения таких моделей требуются сложные оптимизации: маршрутизация токенов, слияние вычислений и распределение весов. NVIDIA NeMo AutoModel решает эту проблему, подклассифицируя AutoModelForCausalLM и добавляя Expert Parallelism (EP), DeepEP (fused all-to-all dispatch) и ядра TransformerEngine.

Ключевое преимущество — полная совместимость API. Пользователю достаточно заменить одну строку импорта, чтобы получить доступ к оптимизациям NVIDIA, сохраняя возможность сохранения чекпоинтов в стандартном формате Hugging Face, совместимом с vLLM и SGLang.

Результаты бенчмарков: масштаб и эффективность

Тестирование проводилось на базе GPU NVIDIA H100 80GB. Результаты демонстрируют критическую важность Expert Parallelism для моделей масштаба 550B и значительный прирост скорости для моделей среднего размера.

Сравнение производительности на моделях 30B MoE

На одном узле с 8 GPU H100 сравнивались Transformers v4, v5 и NeMo AutoModel. Версия v4 полностью зависала (deadlock) из-за несовместимости FSDP-коллективов при динамической маршрутизации токенов. NeMo AutoModel показал максимальную скорость обработки токенов (TPS/GPU).

Метрика Qwen3-30B-A3B (v5 → NeMo) Nemotron 3 Nano 30B A3B (v5 → NeMo)
TPS/GPU (avg) 11,340 (в 3.69x быстрее v5) Данные обрезаны в источнике, но ожидается аналогичный рост
Peak Memory -29% (снижение с 48.1 GiB) -32% (снижение потребления памяти)
Avg Backward Pass 178 ms (в 4.26x быстрее v5) Информация недостаточна

Обучение гигантов: Nemotron 3 Ultra 550B

Для модели Nemotron 3 Ultra 550B A55B (гибридная архитектура с Mamba2 и LatentMoE) тестирование проводилось на кластере из 16 узлов H100 (128 GPU) с Expert Parallelism EP=64. В этом масштабе Transformers v5 не смог запустить полное fine-tuning (full fine-tune) из-за нехватки памяти (OOM). NeMo AutoModel успешно выполнил задачу, достигнув 815 TPS/GPU и используя 58.2 GiB памяти на GPU, что делает возможным обучение моделей уровня frontier-архитектур в распределенной среде.

Почему это важно

NeMo AutoModel устраняет барьер для внедрения MoE-моделей в open-source сообществе. Инженерам больше не нужно писать кастомный код для распределения экспертов или оптимизации коммуникации между GPU. Стандартный API Hugging Face теперь работает с производительностью, близкой к проприетарным фреймворкам, что ускоряет разработку и деплой сложных генеративных моделей.

Источник: Hugging Face blog ↗