AI-новости22 июля 2026 г., 02:19 МСК🤖 Auto

Nvidia Rubin: Архитектура для эры Agentic AI с 50 PFLOPS и HBM4

Nvidia представила архитектуру Rubin для платформы Vera Rubin, оптимизированную под массовый инференс. Ключевые улучшения: 288 ГБ HBM4, ускорение Softmax в 4 раза и оптимизация MoE-моделей.

Баннер новости 4088

Технические характеристики и производительность

Архитектура Rubin объединяет два вычислительных чипа (compute dies) в одном пакете с использованием Nvidia High Bandwidth Interface. Итоговый GPU содержит 224 Streaming Multiprocessors (SM) и 896 Tensor Cores. Главная особенность — 288 ГБ памяти HBM4 с пропускной способностью 22 ТБ/с. Заявленная пиковая производительность для инференса в формате NVFP4 составляет 50 PFLOPS (с учетом разреженности).

Режим работы Производительность
NVFP4 Inference 50 PFLOPS (sparse)
NVFP4 Training 35 PFLOPS
FP8/FP6 Training 17.5 PFLOPS
INT8 250 TOPS
FP16/BF16 4 PFLOPS
TF32 2 PFLOPS
FP32 130 TFLOPS
FP64 33 TFLOPS

Оптимизация MoE-моделей через Tensor Memory Accelerator

Для эффективной работы с моделями типа Mixture-of-Experts (MoE), где активны только подсети, Nvidia доработала Tensor Memory Accelerator (TMA). В архитектуре Blackwell требовалось хранить отдельные дескрипторы для каждого эксперта, что создавало накладные расходы. В Rubin введена поддержка единого унифицированного дескриптора MoE, обновляемого в реальном времени. Это снижает вычислительную нагрузку на метаданные и высвобождает циклы GPU для непосредственных вычислений инференса.

Ускорение Softmax и матричных операций

Ключевые улучшения затронули Special Function Unit (SFU) для операций внимания (attention). Пропускная способность вычислений экспоненты для BF16/FP16 увеличена в 4 раза по сравнению с Blackwell (и в 2 раза по сравнению с Blackwell Ultra). Это критично для обработки длинных контекстов (до 1 млн токенов). Кроме того, пропускная способность по измерению K (внутреннее измерение матриц) удвоена, что сокращает количество итераций цикла умножения матриц.

GPU FP32 Exponential Throughput BF16/FP16 Exponential Throughput
Blackwell 1x 1x
Blackwell Ultra 2x 2x
Rubin 2x 4x

Управление зависимостями и NVLink

В Rubin внедрено более тонкое управление зависимостями между ядрами: потребительские ядра могут запускаться на отдельных thread blocks сразу после готовности данных от производителя, не дожидаясь завершения всего батча. Это снижает задержки и повышает утилизацию GPU. На уровне стойки (rack-scale) оптимизирована коммуникация через NCCL API, позволяя GPU напрямую инициировать обмен данными, что снижает накладные расходы NVLink.

Значение для рынка

Платформа Vera Rubin NVL72, состоящая из 36 CPU Vera и 72 GPU Rubin, позиционируется как ответ Nvidia на спрос Agentic AI. Фокус смещается с обучения моделей на массовый инференс, требующий высокой скорости генерации токенов при низкой себестоимости. Ожидается, что эти архитектурные изменения позволят значительно снизить затраты на единицу сгенерированного токена в сложных агентных рабочих процессах.

Источник: Tom's Hardware ↗