Архитектура без потерь на физическом уровне
NVIDIA NVLink 6, являющийся основой платформы Vera Rubin NVL72, решает проблему транзиторных ошибок не реактивными протоколами, а проактивной многоуровневой системой. На физическом уровне (Physical Layer) используется легковесная коррекция ошибок (FEC) в связке с механизмом повторной передачи на физическом уровне (PLR). Это позволяет исправлять битовые ошибки «на лету» с почти нулевой задержкой. Если ошибка превышает возможности FEC, PLR инициирует мгновенную повторную передачу пакетов, не вовлекая программный стек, что сводит потери пакетов к нулю.
Контроль потока и изоляция сбоев
На канальном уровне (Link Layer) NVLink 6 применяет кредитный контроль потока (CBFC). В отличие от традиционных Ethernet-решений, использующих PFC и ECN, которые подвержены проблемам с блокировкой и «штормам» PFC, CBFC математически исключает переполнение буферов. При возникновении критических сбоев контроллер NMX использует стратегию «contain and drain» (сдерживание и очистка), изолируя неисправность локально и мигрируя функции управления за считанные секунды, пока плоскость данных продолжает работать.
Скорость восстановления инференса
Ключевым показателем эффективности стала функция Shadow Engine Recovery в NVIDIA Dynamo. Архитектура поддерживает предварительно разогретую копию процесса (pre-warmed replica), что позволяет восстановить емкость инференса всего за 7.3 секунды. Для сравнения, холодный запуск на GPU B200 занимает 283 секунды. Это критически важно для минимизации простоев в высоконагруженных средах.
Сравнение производительности и технологий
| Параметр / Технология | NVIDIA NVLink 6 | Традиционный Ethernet (PFC/ECN) |
|---|---|---|
| Механизм без потерь | CBFC (кредитный контроль) + FEC + PLR | Реактивные: PFC, ECN, ACK |
| Задержка восстановления | 7.3 сек (Shadow Engine) | ~283 сек (Cold Start B200) |
| Энд-ту-энд задержка | В 3 раза ниже | Базовая |
| Частота пакетов | В 10 раз выше | Базовая |
Поддержка кастомных ускорителей
Технология NVLink Fusion расширяет стек отказоустойчивости на сторонние ускорители (XPUs), позволяя третьим производителям использовать преимущества масштабируемой шины NVLink. Кроме того, прототип NCCL с поддержкой cuda-checkpoint позволит создавать мультиузловые чекпоинты, захватывающие почти всю работу при старте, что ожидается в конце года.
Источник: NVIDIA dev blog ↗