Третий столп стратегии AMD: Сеть как ключ к масштабируемости
В рамках стратегии Advancing AI 2026 AMD сделала ставку на сетевую инфраструктуру как на критический компонент для работы с моделями с триллионами параметров. Архитектура Helios решает проблему соединения десятков GPU и памяти в единой системе, используя стандартный Ethernet вместо проприетарных решений. Решение состоит из трех слоев: DPU Salina (фронтенд), ткань UALoE (масштабирование внутри стойки) и NIC Vulcano (масштабирование между стойками).
3-е поколение DPU Salina: Ускорение фронтенда
Процессор Salina обеспечивает пропускную способность 400 Гбит/с и берет на себя ускорение безопасности, сети и хранения данных. По заявлениям AMD, он в 2 раза быстрее предыдущего поколения Elba и превосходит NVIDIA BlueField 3 как сетевой шлюз на 1,4x. Ключевая метрика для гиперскейлеров: отгрузка ускоренных соединений освободила в Microsoft 22 CPU-ядра на сервер, которые теперь можно использовать для вычислений.
UALoE: 72 GPU в один пул памяти
Внутри стойки AMD использует технологию UALink over Ethernet (UALoE). Она соединяет 72 GPU в единый домен масштабирования, предоставляя 260 ТБ/с пропускной способности и пул памяти 31 ТБ HBM4. Это превращает всю стойку в один большой GPU. Управление осуществляет Fabric Manager, обеспечивающий программно-определяемые виртуальные POD и отказоустойчивость: при сбое части системы весь кластер остается работоспособным.
Vulcano AI NIC: 800G и экономия бюджета
Для соединения нескольких стоек (scale-out) используется 2-е поколение сетевых карт Vulcano со скоростью 800 Гбит/с (2,4 Тбит/с на GPU за счет 3 карт). AMD заявляет о росте пропускной способности scale-out на 50% и ускорении обучения LLM на 13% благодаря интеллектуальной маршрутизации пакетов. Главное преимущество — кастомное решение вместо чипов Broadcom Tomahawk 6 снизило затраты на масштабирование на 33%.
| Компонент | Характеристики / Метрики | Ключевое преимущество |
|---|---|---|
| Pensando Salina (DPU) | 400 Гбит/с, 3-е поколение | В 2x быстрее Elba, экономия 22 CPU-ядер (Microsoft) |
| UALoE (Fabric) | 72 GPU, 260 ТБ/с, 31 ТБ HBM4 | Единый пул памяти, отказоустойчивость Fabric Manager |
| Vulcano AI NIC | 800 Гбит/с, PCIe Gen 6 | +50% к scale-out, -33% к затратам vs Broadcom |
Почему это важно
Переход на Ethernet в AI-инфраструктуре позволяет клиентам избегать вендор-лока и снижать CAPEX. Сочетание высокой пропускной способности HBM4 и кастомных сетевых решений делает AMD сильным конкурентом NVIDIA в сегменте крупномасштабных AI-кластеров.
Источник: TechPowerUp ↗
