AI-новости20 июля 2026 г., 19:00 МСК🤖 Auto

NVIDIA NVLink 6: 3.6 ТБ/с на GPU и 2.3x быстрее Ethernet для AI-фабрик

NVIDIA представила шестое поколение NVLink с пропускной способностью до 3.6 ТБ/с на GPU, обеспечивая 2.3-кратное ускорение декодирования MoE-моделей по сравнению с Ethernet.

Баннер новости 3965

Архитектура нового поколения: цифры и возможности

Компания NVIDIA официально представила шестое поколение технологии NVLink, позиционируемое как ключевой элемент инфраструктуры для «AI-фабрик» (AI factories). Это решение предназначено для обеспечения высокоскоростной связи между графическими процессорами с минимальной задержкой, что критически важно для обучения и инференса современных больших языковых моделей (LLM) и архитектур Mixture-of-Experts (MoE).

Ключевые технические характеристики нового поколения:

  • Пропускная способность на GPU: до 3.6 ТБ/с.
  • Общая пропускная способность стойки: 260 ТБ/с.
  • Вычислительная мощность в сети: 130 TFLOPS (за счет технологии SHARP для обработки коллективных операций непосредственно в коммутаторах).
  • Топология: all-to-all (все-со-всеми) с поддержкой NVLink 6 Switch.

Сравнение с Ethernet: почему это важно для MoE

Основная проблема современных AI-нагрузок, особенно моделей с архитектурой Mixture-of-Experts (таких как DeepSeek-R1, Qwen 235B или симулированная модель на 2 триллиона параметров), заключается в интенсивном обмене данными между GPU. При экспертном параллелизме токены должны распределяться по экспертам, обрабатываться и собираться обратно. Если сеть медленная, выигрыш от параллелизма нивелируется накладными расходами на коммуникацию.

Согласно данным NVIDIA, шестое поколение NVLink обеспечивает до 2.3-кратного увеличения пропускной способности декодирования по сравнению с решениями Ethernet off-the-shelf (OTS) в домене масштабирования из 72 ускорителей. Это напрямую влияет на стоимость токена и энергоэффективность.

Параметр NVIDIA NVLink 6 Off-the-Shelf Ethernet
Пропускная способность (на GPU) 3.6 ТБ/с Значительно ниже (ограничена стандартами PCIe/InfiniBand/ETH)
Ускорение декодирования MoE Базовый уровень (1x) До 2.3x медленнее
Вычисления в сети (In-network compute) 130 TFLOPS (SHARP) Отсутствует или ограничено
Задержка (Latency) Минимальная, оптимизированная для all-to-all Выше, что критично для инференса

Экономика AI-фабрик: от FLOPS к токенам

Традиционные метрики пиковой производительности в FLOPS больше не являются достаточными. Современная архитектура требует, чтобы ускорители работали как единый вычислительный узел. NVLink 6 позволяет оптимизировать три ключевых показателя эффективности:

  1. Tokens per Watt: Улучшение в 50 раз при переходе от архитектуры Hopper к Blackwell.
  2. Tokens per Dollar: Снижение стоимости вывода модели за счет высокой утилизации.
  3. Tokens per Square Foot: Плотность вычислений в стойке.

Технология включает функции отказоустойчивости для производства: горячую замену модулей коммутаторов, динамическую маршрутизацию, обновления в режиме службы и детализированную телеметрию. Это обеспечивает стабильный ROI (возврат инвестиций) за счет минимизации простоев.

Экосистема и будущее: NVLink-C2C и Fusion

Платформа NVLink 6 является частью стратегии экстремального со-дизайна (extreme co-design), где аппаратное обеспечение, прошивка и программное обеспечение (NVIDIA Dynamo, TensorRT-LLM, NCCL, NIXL) оптимизируются совместно. Это позволяет реализовать такие функции, как дисагрегированный инференс и динамическое распределение ресурсов.

Для будущего масштабирования NVIDIA анонсировала поддержку NVLink-C2C для обеспечения когерентности памяти между CPU и GPU, а также NVLink Fusion для бесшовной интеграции пользовательских XPU. Это гарантирует, что инфраструктура останется актуальной по мере усложнения моделей и роста требований к памяти.

Источник: NVIDIA dev blog ↗