Эра гигаскейла и новый стандарт пропускной способности
Индустрия искусственного интеллекта перешла в стадию «гигаскейла» (gigascale), где модели обучаются на сотнях тысяч GPU и CPU одновременно. В таких масштабах сеть становится критическим множителем вычислительной мощности. NVIDIA представила Spectrum-6 — коммутаторную систему на базе Ethernet, обеспечивающую пропускную способность 102.4 терабита в секунду. Это решение является частью платформы NVIDIA Vera Rubin и предназначено для работы в качестве единой вычислительной системы.
Ключевые технические характеристики и интеграция
Spectrum-6 не работает изолированно. Он является центральным элементом следующей эры платформы NVIDIA Spectrum-X Ethernet. Чип Spectrum-6 комбинируется с сетевым адаптером ConnectX-9 SuperNIC для создания полностью интегрированного стека. Архитектура включает:
- Процессоры NVIDIA Vera и графические ускорители Rubin.
- Коммутаторы NVLink 6 для связи GPU.
- Датчики-процессоры данных BlueField-4 DPU.
- Поддержка как плагируемой, так и ко-пакетной оптики.
- Полная поддержка жидкостного охлаждения для повышения энергоэффективности всей фабрики.
Производительность против «оф-те-шелф» решений
Стандартный Ethernet исторически создавался для корпоративного трафика (north-south), а не для массовых коллективных коммуникаций (east-west), необходимых при обучении ИИ. Платформа Spectrum-X решает эту проблему, обеспечивая:
- До 1.6x выше производительность ИИ-сети по сравнению с обычным Ethernet.
- 95% эффективности сети в развертываниях, превышающих 100 000 GPU.
- Снижение количества необходимых коммутаторов в 1.7 раза за счет аппаратно ускоренных топологий Spectrum-X multiplane.
- Повышение энергоэффективности в 5 раз и улучшение показателя MTBF (наработка на отказ) в 10 раз благодаря оптическим решениям Photonics.
Первые клиенты и экономический эффект
Среди первых пользователей Spectrum-6 — ведущие инфраструктурные компании: CoreWeave, Microsoft, Nebius, SpaceXAI и Tesla. Для облачных провайдеров это означает возможность объединить вычислительные мощности в единый высокопроизводительный ресурс, ускоряя обучение моделей и развертывание сервисов вывода (inference).
Мин Юн (Min Jun, CoreWeave) отметил, что интеграция жидкостного охлаждения и Spectrum-6 критична для доставки необходимой пропускной способности и отказоустойчивости. Лорелл Роузман (Nebius) добавила, что на гигаскейле производительность зависит от координации: сеть должна оставаться быстрой, чтобы один медленный канал не останавливал всю работу.
Сравнительные метрики платформы
| Параметр | NVIDIA Spectrum-X Ethernet (Spectrum-6) | Стандартный Ethernet (Off-the-shelf) |
|---|---|---|
| Пропускная способность коммутатора | 102.4 Тбит/с | Информация недостаточна (предыдущее поколение ~51.2 Тбит/с) |
| Относительная производительность ИИ | До 1.6x выше | Базовый уровень (1x) |
| Эффективность сети (при >100k GPU) | До 95% | Значительно ниже (узкое место в коллективных операциях) |
| Количество коммутаторов (топология) | Снижено в 1.7x | Стандартное |
Решение позиционируется как способ достижения самого быстрого времени обучения и наименьшей стоимости за токен (cost per token) за счет вертикальной интеграции кремния, систем и программного обеспечения.
Источник: NVIDIA Blog ↗
