Инструменты28 сентября 2026 г., 13:47 МСК🤖 Auto

NVIDIA Model Optimizer: NVFP4 и прунинг ускоряют LLM до 5.9x

NVIDIA представила обновленную библиотеку Model Optimizer, позволяющую сжимать модели до 5.9x по скорости и 3.1x по размеру с помощью NVFP4, прунинга и дистилляции.

Баннер новости 8416

От TensorRT к единому стандарту оптимизации

NVIDIA официально переименовала библиотеку TensorRT Model Optimizer в NVIDIA Model Optimizer (ModelOpt). Это не просто смена имени: теперь это единый open-source фреймворк, интегрирующий квантизацию, прунинг, дистилляцию, поиск архитектуры (NAS) и спекулятивное декодирование. Библиотека работает с моделями Hugging Face (Transformers и Diffusers), PyTorch и ONNX, а результаты экспортируются напрямую в SGLang, TensorRT-LLM, TensorRT и vLLM.

Прорыв с NVFP4 и Nemotron 3 Ultra

Ключевое достижение — поддержка формата NVFP4 (NVIDIA FP4). В июне 2026 года NVIDIA опубликовала результаты квантования модели Nemotron 3 Ultra (550B параметров) до NVFP4. Результат превзошел ожидания: скорость декодирования выросла в 5.9 раз по сравнению с GLM-5.1 754B в FP4, при этом точность осталась на уровне BF16. Это делает NVFP4 стандартом для эффективного инференса на GPU Blackwell.

Практические кейсы: от 33% до 60% экономии

Библиотека уже используется крупными компаниями для оптимизации своих моделей. Ниже приведены конкретные метрики оптимизации, достигнутые с помощью ModelOpt:

Компания / Модель Техника Результат
Bielik.AI (Bielik Minitron 7B) Pruning + Distillation Модель стала на 33% меньше, скорость выросла на 50%, качество сохранилось на 90%
Domyn (Colosseum 355B → 260B) Minitron Pruning + Distillation Сокращение размера модели с 355B до 260B параметров
Adobe (Diffusion models) Model-Optimizer + TensorRT Задержка генерации снижена на 60%, TCO уменьшен на 40%
Qwen3.6-35B-A3B (Tutorial) NVFP4 W4A4 PTQ + QAD Пропускная способность vLLM выросла в 1.30x, размер чекпоинта уменьшился в 3.1x

Новые алгоритмы: Puzzletron и AutoQuantize

В апреле 2026 года был представлен алгоритм Puzzletron для гетерогенного прунинга и NAS, а в августе — AutoQuantize для автоматического назначения смешанной точности. Эти инструменты позволяют автоматизировать процесс поиска оптимальной архитектуры и точности, снижая порог входа для разработчиков.

Как начать работу

Библиотека доступна через PyPI и Docker-образы NVIDIA. Для установки последней версии достаточно выполнить:

  • pip install -U nvidia-modelopt[all]
  • Использование контейнеров: nvcr.io/nvidia/pytorch:-py3

Все оптимизированные чекпоинты (FP8, NVFP4) для моделей Llama, DeepSeek и Nemotron уже доступны на Hugging Face.

Источник: Github ↗