Технические характеристики и производительность
Архитектура Rubin объединяет два вычислительных чипа (compute dies) в одном пакете с использованием Nvidia High Bandwidth Interface. Итоговый GPU содержит 224 Streaming Multiprocessors (SM) и 896 Tensor Cores. Главная особенность — 288 ГБ памяти HBM4 с пропускной способностью 22 ТБ/с. Заявленная пиковая производительность для инференса в формате NVFP4 составляет 50 PFLOPS (с учетом разреженности).
| Режим работы | Производительность |
|---|---|
| NVFP4 Inference | 50 PFLOPS (sparse) |
| NVFP4 Training | 35 PFLOPS |
| FP8/FP6 Training | 17.5 PFLOPS |
| INT8 | 250 TOPS |
| FP16/BF16 | 4 PFLOPS |
| TF32 | 2 PFLOPS |
| FP32 | 130 TFLOPS |
| FP64 | 33 TFLOPS |
Оптимизация MoE-моделей через Tensor Memory Accelerator
Для эффективной работы с моделями типа Mixture-of-Experts (MoE), где активны только подсети, Nvidia доработала Tensor Memory Accelerator (TMA). В архитектуре Blackwell требовалось хранить отдельные дескрипторы для каждого эксперта, что создавало накладные расходы. В Rubin введена поддержка единого унифицированного дескриптора MoE, обновляемого в реальном времени. Это снижает вычислительную нагрузку на метаданные и высвобождает циклы GPU для непосредственных вычислений инференса.
Ускорение Softmax и матричных операций
Ключевые улучшения затронули Special Function Unit (SFU) для операций внимания (attention). Пропускная способность вычислений экспоненты для BF16/FP16 увеличена в 4 раза по сравнению с Blackwell (и в 2 раза по сравнению с Blackwell Ultra). Это критично для обработки длинных контекстов (до 1 млн токенов). Кроме того, пропускная способность по измерению K (внутреннее измерение матриц) удвоена, что сокращает количество итераций цикла умножения матриц.
| GPU | FP32 Exponential Throughput | BF16/FP16 Exponential Throughput |
|---|---|---|
| Blackwell | 1x | 1x |
| Blackwell Ultra | 2x | 2x |
| Rubin | 2x | 4x |
Управление зависимостями и NVLink
В Rubin внедрено более тонкое управление зависимостями между ядрами: потребительские ядра могут запускаться на отдельных thread blocks сразу после готовности данных от производителя, не дожидаясь завершения всего батча. Это снижает задержки и повышает утилизацию GPU. На уровне стойки (rack-scale) оптимизирована коммуникация через NCCL API, позволяя GPU напрямую инициировать обмен данными, что снижает накладные расходы NVLink.
Значение для рынка
Платформа Vera Rubin NVL72, состоящая из 36 CPU Vera и 72 GPU Rubin, позиционируется как ответ Nvidia на спрос Agentic AI. Фокус смещается с обучения моделей на массовый инференс, требующий высокой скорости генерации токенов при низкой себестоимости. Ожидается, что эти архитектурные изменения позволят значительно снизить затраты на единицу сгенерированного токена в сложных агентных рабочих процессах.
Источник: Tom's Hardware ↗
