Революция масштаба: от сервера к стойке
На мероприятии AMD Advancing AI компания представила не просто новый чип, а полноценную вычислительную appliance-систему под названием Helios. Это ответ на растущие требования ИИ-индустрии: модели становятся слишком большими для одного сервера как по вычислительной мощности, так и по объему памяти. Helios объединяет несколько серверов и типов узлов в единую когерентную машину, используя высокоскоростные сети для связи компонентов.
Ключевым отличием Helios от традиционных кластеров является интеграция технологий масштабирования (scale-up) прямо в GPU и создание специализированной сетевой инфраструктуры, позволяющей узлам внутри стойки работать как единый процессор. Это решение стало возможным благодаря приобретению компании Pensando в 2022 году, чьи технологии DPU/NIC теперь являются неотъемлемой частью архитектуры.
Железо: EPYC, MI455X и HBM4
В основе Helios лежат три ключевых компонента AMD:
- CPU: EPYC 9006 «Venice» — обеспечивают оркестрацию и обработку данных.
- GPU: Instinct MI455X — вычислительное ядро системы.
- Networking: DPU/NIC от Pensando — отвечают за высокоскоростную передачу данных.
Система построена на базе новой памяти HBM4, что позволяет преодолеть классическое «бутылочное горлышко» ИИ-инференса, связанное с пропускной способностью памяти. Каждая GPU MI455X оснащена 432 ГБ HBM4 с пропускной способностью 23.3 ТБ/с.
Цифры и производительность
Технические характеристики отгружаемой версии Helios оказались даже лучше первоначальных прогнозов AMD. Система, состоящая из 72 GPU, демонстрирует следующие метрики:
| Параметр | Значение | Примечание |
|---|---|---|
| Пиковая вычислительная мощность (MXFP4) | 2.9 EFLOPS | Суммарная для всей стойки |
| Общий объем памяти HBM4 | 31 ТБ | 432 ГБ на каждую из 72 GPU |
| Суммарная пропускная способность памяти | 1.7 PB/с | На 21% выше первоначальных планов AMD |
| Пропускная способность сети (Scale-up) | 260 ТБ/с | Внутри одной стойки Helios |
| Пропускная способность сети (Scale-out) | 43 ТБ/с | Для объединения нескольких стоек |
Почему это важно для рынка
Увеличение пропускной способности памяти на 21% по сравнению с изначальными спецификациями — это не просто техническая деталь. В эпоху больших языковых моделей (LLM) и генеративного ИИ скорость доступа к данным часто ограничивает скорость вычислений. Предоставление 1.7 PB/с общей пропускной способности делает Helios одним из самых мощных решений для инференса и обучения.
Сетевая архитектура также выделяется: 260 ТБ/с внутри стойки позволяют GPU обмениваться данными практически мгновенно, имитируя работу одного гигантского процессора. Это позиционирует AMD как серьезного конкурента NVIDIA в сегменте rack-scale систем, где ранее доминировали решения на базе NVLink и InfiniBand.
Статус производства
По состоянию на Advancing AI, архитектура Helios и все ее компоненты перешли в стадию серийного производства. AMD заявляет, что это первый в истории компании истинный rack-scale продукт, который может быть развернут в дата-центрах для решения задач, недоступных для стандартных серверных конфигураций.
Источник: ServeTheHome ↗
