Архитектура нового поколения: цифры и возможности
Компания NVIDIA официально представила шестое поколение технологии NVLink, позиционируемое как ключевой элемент инфраструктуры для «AI-фабрик» (AI factories). Это решение предназначено для обеспечения высокоскоростной связи между графическими процессорами с минимальной задержкой, что критически важно для обучения и инференса современных больших языковых моделей (LLM) и архитектур Mixture-of-Experts (MoE).
Ключевые технические характеристики нового поколения:
- Пропускная способность на GPU: до 3.6 ТБ/с.
- Общая пропускная способность стойки: 260 ТБ/с.
- Вычислительная мощность в сети: 130 TFLOPS (за счет технологии SHARP для обработки коллективных операций непосредственно в коммутаторах).
- Топология: all-to-all (все-со-всеми) с поддержкой NVLink 6 Switch.
Сравнение с Ethernet: почему это важно для MoE
Основная проблема современных AI-нагрузок, особенно моделей с архитектурой Mixture-of-Experts (таких как DeepSeek-R1, Qwen 235B или симулированная модель на 2 триллиона параметров), заключается в интенсивном обмене данными между GPU. При экспертном параллелизме токены должны распределяться по экспертам, обрабатываться и собираться обратно. Если сеть медленная, выигрыш от параллелизма нивелируется накладными расходами на коммуникацию.
Согласно данным NVIDIA, шестое поколение NVLink обеспечивает до 2.3-кратного увеличения пропускной способности декодирования по сравнению с решениями Ethernet off-the-shelf (OTS) в домене масштабирования из 72 ускорителей. Это напрямую влияет на стоимость токена и энергоэффективность.
| Параметр | NVIDIA NVLink 6 | Off-the-Shelf Ethernet |
|---|---|---|
| Пропускная способность (на GPU) | 3.6 ТБ/с | Значительно ниже (ограничена стандартами PCIe/InfiniBand/ETH) |
| Ускорение декодирования MoE | Базовый уровень (1x) | До 2.3x медленнее |
| Вычисления в сети (In-network compute) | 130 TFLOPS (SHARP) | Отсутствует или ограничено |
| Задержка (Latency) | Минимальная, оптимизированная для all-to-all | Выше, что критично для инференса |
Экономика AI-фабрик: от FLOPS к токенам
Традиционные метрики пиковой производительности в FLOPS больше не являются достаточными. Современная архитектура требует, чтобы ускорители работали как единый вычислительный узел. NVLink 6 позволяет оптимизировать три ключевых показателя эффективности:
- Tokens per Watt: Улучшение в 50 раз при переходе от архитектуры Hopper к Blackwell.
- Tokens per Dollar: Снижение стоимости вывода модели за счет высокой утилизации.
- Tokens per Square Foot: Плотность вычислений в стойке.
Технология включает функции отказоустойчивости для производства: горячую замену модулей коммутаторов, динамическую маршрутизацию, обновления в режиме службы и детализированную телеметрию. Это обеспечивает стабильный ROI (возврат инвестиций) за счет минимизации простоев.
Экосистема и будущее: NVLink-C2C и Fusion
Платформа NVLink 6 является частью стратегии экстремального со-дизайна (extreme co-design), где аппаратное обеспечение, прошивка и программное обеспечение (NVIDIA Dynamo, TensorRT-LLM, NCCL, NIXL) оптимизируются совместно. Это позволяет реализовать такие функции, как дисагрегированный инференс и динамическое распределение ресурсов.
Для будущего масштабирования NVIDIA анонсировала поддержку NVLink-C2C для обеспечения когерентности памяти между CPU и GPU, а также NVLink Fusion для бесшовной интеграции пользовательских XPU. Это гарантирует, что инфраструктура останется актуальной по мере усложнения моделей и роста требований к памяти.
Источник: NVIDIA dev blog ↗
