Инструменты10 сентября 2026 г., 20:01 МСК🤖 Auto

Nemotron 3 Ultra: ускорение в 2.5x на B200 благодаря NIM 2.0.12

NVIDIA представила оптимизированный стек NIM 2.0.12 для модели Nemotron 3 Ultra, обеспечивший рост пропускной способности в 2.5 раза на системе из 4 GPU B200 без потери интерактивности.

Баннер новости 7194

Результаты бенчмарка: от 718 до 1997 токенов/с

Ключевое достижение — увеличение системной пропускной способности (throughput) при строгом соблюдении целевой нагрузки в 50 TPS (transactions per second) на пользователя. Это критически важно для агентных AI-приложений, где задержки напрямую влияют на UX. Оптимизированный стек NIM 2.0.12 показал результат 1,997 токенов в секунду, что более чем в 2.5 раза превышает базовый показатель в 718 токенов/с.

Конфигурация Пропускная способность (tok/s) Описание
NIM Off (Baseline) 718 Базовый open-source стек без оптимизаций NIM
NIM On (2.0.12) 1,997 Полностью оптимизированный стек: кэширование, MTP, autotuned kernels

Технические драйверы производительности

Рост эффективности достигнут не за счет одного «волшебного переключателя», а благодаря комплексной настройке нескольких слоев системы:

  • Autotuned kernels: Ядра для MoE (Mixture-of-Experts) и Mamba архитектуры автоматически подбираются под конкретное железо Blackwell.
  • Prefix & State Reuse: Кэширование префиксов (prefix caching) и частичное совпадение префиксов (partial-prefix matching) исключают повторные вычисления для повторяющегося контекста, что типично для агентов.
  • MTP Speculative Decoding: Внедрение Multi-Token Prediction (MTP) с соответствующими исправлениями дало дополнительный прирост, зависящий от уровня принятия предложенных токенов.
  • Планировщик и память: Тонкая настройка лимитов одновременных последовательностей, размера батчей и распределения GPU-памяти позволила удерживать больше задач в полете, не нарушая SLA по задержкам.

Как внедрить и протестировать

Для воспроизведения результатов или адаптации под свои нагрузки NVIDIA рекомендует использовать инструмент NVIDIA AIPerf. Он позволяет воспроизвести репрезентативный трафик (в формате Mooncake JSONL) и построить кривую Парето, чтобы найти точку, удовлетворяющую вашим требованиям по латентности.

Для развертывания используется образ nvcr.io/nim/nvidia/nemotron-3-ultra-550b-a55b:2.0.12. Для агентных нагрузок на системе из 4xB200 рекомендуется профиль vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0 с включенным спекулятивным декодированием через переменную NIM_SPECDEC_ENABLE=1.

Источник: NVIDIA dev blog ↗