Результаты бенчмарка: от 718 до 1997 токенов/с
Ключевое достижение — увеличение системной пропускной способности (throughput) при строгом соблюдении целевой нагрузки в 50 TPS (transactions per second) на пользователя. Это критически важно для агентных AI-приложений, где задержки напрямую влияют на UX. Оптимизированный стек NIM 2.0.12 показал результат 1,997 токенов в секунду, что более чем в 2.5 раза превышает базовый показатель в 718 токенов/с.
| Конфигурация | Пропускная способность (tok/s) | Описание |
|---|---|---|
| NIM Off (Baseline) | 718 | Базовый open-source стек без оптимизаций NIM |
| NIM On (2.0.12) | 1,997 | Полностью оптимизированный стек: кэширование, MTP, autotuned kernels |
Технические драйверы производительности
Рост эффективности достигнут не за счет одного «волшебного переключателя», а благодаря комплексной настройке нескольких слоев системы:
- Autotuned kernels: Ядра для MoE (Mixture-of-Experts) и Mamba архитектуры автоматически подбираются под конкретное железо Blackwell.
- Prefix & State Reuse: Кэширование префиксов (prefix caching) и частичное совпадение префиксов (partial-prefix matching) исключают повторные вычисления для повторяющегося контекста, что типично для агентов.
- MTP Speculative Decoding: Внедрение Multi-Token Prediction (MTP) с соответствующими исправлениями дало дополнительный прирост, зависящий от уровня принятия предложенных токенов.
- Планировщик и память: Тонкая настройка лимитов одновременных последовательностей, размера батчей и распределения GPU-памяти позволила удерживать больше задач в полете, не нарушая SLA по задержкам.
Как внедрить и протестировать
Для воспроизведения результатов или адаптации под свои нагрузки NVIDIA рекомендует использовать инструмент NVIDIA AIPerf. Он позволяет воспроизвести репрезентативный трафик (в формате Mooncake JSONL) и построить кривую Парето, чтобы найти точку, удовлетворяющую вашим требованиям по латентности.
Для развертывания используется образ nvcr.io/nim/nvidia/nemotron-3-ultra-550b-a55b:2.0.12. Для агентных нагрузок на системе из 4xB200 рекомендуется профиль vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0 с включенным спекулятивным декодированием через переменную NIM_SPECDEC_ENABLE=1.
Источник: NVIDIA dev blog ↗
