От TensorRT к единому стандарту оптимизации
NVIDIA официально переименовала библиотеку TensorRT Model Optimizer в NVIDIA Model Optimizer (ModelOpt). Это не просто смена имени: теперь это единый open-source фреймворк, интегрирующий квантизацию, прунинг, дистилляцию, поиск архитектуры (NAS) и спекулятивное декодирование. Библиотека работает с моделями Hugging Face (Transformers и Diffusers), PyTorch и ONNX, а результаты экспортируются напрямую в SGLang, TensorRT-LLM, TensorRT и vLLM.
Прорыв с NVFP4 и Nemotron 3 Ultra
Ключевое достижение — поддержка формата NVFP4 (NVIDIA FP4). В июне 2026 года NVIDIA опубликовала результаты квантования модели Nemotron 3 Ultra (550B параметров) до NVFP4. Результат превзошел ожидания: скорость декодирования выросла в 5.9 раз по сравнению с GLM-5.1 754B в FP4, при этом точность осталась на уровне BF16. Это делает NVFP4 стандартом для эффективного инференса на GPU Blackwell.
Практические кейсы: от 33% до 60% экономии
Библиотека уже используется крупными компаниями для оптимизации своих моделей. Ниже приведены конкретные метрики оптимизации, достигнутые с помощью ModelOpt:
| Компания / Модель | Техника | Результат |
|---|---|---|
| Bielik.AI (Bielik Minitron 7B) | Pruning + Distillation | Модель стала на 33% меньше, скорость выросла на 50%, качество сохранилось на 90% |
| Domyn (Colosseum 355B → 260B) | Minitron Pruning + Distillation | Сокращение размера модели с 355B до 260B параметров |
| Adobe (Diffusion models) | Model-Optimizer + TensorRT | Задержка генерации снижена на 60%, TCO уменьшен на 40% |
| Qwen3.6-35B-A3B (Tutorial) | NVFP4 W4A4 PTQ + QAD | Пропускная способность vLLM выросла в 1.30x, размер чекпоинта уменьшился в 3.1x |
Новые алгоритмы: Puzzletron и AutoQuantize
В апреле 2026 года был представлен алгоритм Puzzletron для гетерогенного прунинга и NAS, а в августе — AutoQuantize для автоматического назначения смешанной точности. Эти инструменты позволяют автоматизировать процесс поиска оптимальной архитектуры и точности, снижая порог входа для разработчиков.
Как начать работу
Библиотека доступна через PyPI и Docker-образы NVIDIA. Для установки последней версии достаточно выполнить:
pip install -U nvidia-modelopt[all]- Использование контейнеров:
nvcr.io/nvidia/pytorch:-py3
Все оптимизированные чекпоинты (FP8, NVFP4) для моделей Llama, DeepSeek и Nemotron уже доступны на Hugging Face.
Источник: Github ↗
