Новый стандарт эффективности: от Blackwell к Rubin
NVIDIA официально представила архитектуру GPU Rubin, ставшую сердцем новой вычислительной платформы Vera Rubin. Главная цель — поддержка эпохи Agentic AI, где модели не просто отвечают на запросы, а самостоятельно планируют, используют инструменты и выполняют многошаговые задачи. В отличие от предыдущего поколения Blackwell, Rubin обеспечивает до 10-кратного увеличения пропускной способности агентов на единицу потребленной энергии. Это достигается за счет перехода к более плотной интеграции и специализированным оптимизациям для длительных контекстов и смешанных экспертных моделей (MoE).
Железо: 336 млрд транзисторов и революция памяти
Архитектура Rubin построена на двух кристаллах, объединенных через высокоскоростной интерфейс NV-HBI. Общая плотность составляет 336 миллиардов транзисторов. Ключевым отличием от предшественников стала интеграция памяти нового поколения:
- Объем: до 288 ГБ HBM4 (High Bandwidth Memory 4).
- Пропускная способность: 22 ТБ/с (терабайта в секунду).
- Вычислительная мощность: 224 Streaming Multiprocessors (SM) и 896 Tensor Cores.
- Производительность: до 50 петафлопс в формате NVFP4 благодаря третьему поколению Transformer Engine.
Оптимизация Agentic-нагрузок: MoE и Long-Context
Агентные задачи требуют низкой задержки на каждом шаге рассуждения. NVIDIA внедрила несколько архитектурных улучшений для устранения узких мест:
- Inline Descriptor Updates: Улучшенный Tensor Memory Accelerator (TMA) позволяет обновлять дескрипторы прямо в инструкции, что критически важно для масштабирования MoE-моделей с большим количеством экспертов.
- Двойная эффективность GEMM: Увеличение пропускной способности по измерению K вдвое снижает количество итераций циклов, повышая утилизацию Tensor Core для матричных операций.
- Активационная разреженность и адаптивное сжатие: Технологии минимизируют задержки при переходах между ядрами и оптимизируют работу с длинными контекстами.
Масштабирование: Vera Rubin NVL72
На уровне стойки платформа Vera Rubin NVL72 использует жидкостное охлаждение и архитектуру MGX без кабелей. Система поддерживает сглаживание питания (DSX MaxLPS) и позволяет разместить до 40% больше GPU в том же энергетическом бюджете по сравнению с предыдущими решениями, обеспечивая отказоустойчивость и высокую пропускную способность для моделей с триллионами параметров.
Сравнение ключевых характеристик
| Параметр | NVIDIA Blackwell | NVIDIA Rubin |
|---|---|---|
| Транзисторы (общие) | ~141 млрд (B200) | 336 млрд |
| Память | HBM3e | HBM4 (288 ГБ) |
| Пропускная способность памяти | ~4.8 ТБ/с (на чип) | 22 ТБ/с |
| Производительность Tensor Cores | Высокая (FP4/FP8) | До 50 PFLOPS (NVFP4) |
| Рост эффективности Agentic AI | База | До 10x (на единицу энергии) |
Источник: NVIDIA dev blog ↗
