Абсолютное лидерство в бенчмарках
В рамках закрытой категории MLPerf Inference v6.1 NVIDIA опубликовала предварительные результаты тестирования системы Vera Rubin NVL72. Система продемонстрировала выдающиеся показатели на двух самых требовательных бенчмарках: DeepSeek-R1 и Qwen3-VL. Ключевым достижением стал рост пропускной способности (throughput) до 3.7 раз по сравнению с предыдущим поколением GB300 NVL72 в сценариях offline, server и interactive для модели Qwen3-VL. Для модели DeepSeek-R1 прирост составил до 2.5x.
Технологический прорыв: NVFP4 и Disaggregated Serving
Высокие результаты обеспечены полным стековым ко-дизайном. Архитектура Vera Rubin использует улучшенные Tensor Cores и Transformer Engine, а также формат NVFP4, который снижает потребление памяти для весов модели, внимания и KV-кэша. Это позволяет увеличить пропускную способность при минимальной потере качества вывода. Кроме того, NVIDIA активно применяет технологию disaggregated serving (разделение этапов prefill и decode) и крупномасштабное экспертное параллелизм (expert parallelism), что критически важно для эффективной работы моделей типа MoE (Mixture of Experts).
Эффективность масштабирования GB300
Параллельно NVIDIA подтвердила эффективность текущей платформы GB300. Тестирование системы из 288 GPU, развернутой на четырех стойках GB300 NVL72, показало 99% эффективность масштабирования. Пропускная способность росла почти линейно по мере добавления ресурсов, что доказывает предсказуемость и экономическую целесообразность расширения кластеров. Это достигается за счет шестого поколения NVLink и NVLink Switch, обеспечивающих в 10 раз более высокую частоту пакетов и в 3 раза меньшую задержку по сравнению с обычным Ethernet.
Сравнительные характеристики производительности
Ниже приведены ключевые метрики сравнения Vera Rubin NVL72 с предшественником GB300 NVL72 в рамках MLPerf Inference v6.1:
| Модель / Сценарий | Улучшение производительности (Throughput) | Используемый фреймворк/Библиотека |
|---|---|---|
| Qwen3-VL (offline, server, interactive) | до 3.7x | vLLM + NVIDIA Dynamo |
| DeepSeek-R1 | до 2.5x | NVIDIA TensorRT-LLM |
| Масштабирование GB300 (288 GPU) | 99% эффективность | NVLink Switch (6-го поколения) |
Экономический эффект и будущее
Рост производительности напрямую влияет на экономику AI-инференса: каждая стойка Vera Rubin NVL72 генерирует значительно больше токенов и обслуживает больше пользователей, снижая стоимость за токен. Программные оптимизации в MLPerf Inference v6.1 уже дали прирост до 1.6x по сравнению с версией 6.0, а работа над улучшением продолжается и после подачи результатов. Особое внимание уделяется AI-агентам, которые требуют многошагового рассуждения, планирования и действий, что меняет парадигму оценки производительности систем.
Источник: NVIDIA Blog ↗
