Архитектура CDNA 5 и гибридная упаковка
AMD официально представила Instinct MI455X, назвав его самым продвинутым ИИ-ускорителем в истории компании. Чип содержит 320 миллиардов транзисторов и построен на передовом техпроцессе TSMC 2N (GAA) для Accelerator Complex Dies (XCD) и TSMC N3P для остальных компонентов. Архитектура CDNA 5 претерпела ключевые изменения: базовый блок теперь называется Work Group Processor (WGP), а ширина волнового фронта сокращена с 64 до 32 бит. Это решение, заимствованное у RDNA, улучшает задержки инструкций и снижает давление на регистры, повышая гибкость при работе с тензорными тайлами.
Память HBM4: главное преимущество над Nvidia
Ключевым отличием MI455X от конкурентов стала память. AMD перешла на HBM4, установив 12 стеков на чип. Это обеспечивает объем 432 ГБ и пропускную способность 23,3 ТБ/с на один GPU. Для сравнения, первый вариант Nvidia Rubin предлагает 288 ГБ HBM4 с пропускной способностью до 22 ТБ/с. В масштабах стойки Helios (72 GPU) AMD предлагает 31,1 ТБ общей памяти, что на 50% больше, чем 20,7 ТБ у системы Nvidia Vera Rubin.
Производительность и кэш-память
AMD отказалась от Infinity Cache в пользу более быстрого и компактного L2 кэша (192 МБ суммарно на чип) и удвоила локальное хранилище (LDS) до 96 МБ. Это позволяет значительно ускорить вычисления. Ниже приведено сравнение пиковой производительности MI455X с предшественником MI355X и Nvidia Rubin:
| Формат / Тип вычислений | Instinct MI355X (CDNA 4) | Instinct MI455X (CDNA 5) | Nvidia Rubin |
|---|---|---|---|
| OCP MXFP4 | 10 PF | 40.26 PF | -- |
| OCP MXFP6 / MXFP8 | 10 PF | 20.13 PF | 17.5 PF |
| Matrix FP16/BF16 | 2.5 PF | 5.03 PF | 4 PF |
| Vector FP16 | 157.3 TF | 315 TF | -- |
| Matrix FP32 | 157.3 TF | 315 TF | 400 TF |
Система Helios и реальные клиенты
MI455X является частью новой rack-scale архитектуры Helios, которая объединяет 72 GPU в единую когерентную область памяти. Это позволяет AMD конкурировать с Nvidia NVL72 на уровне всей стойки, а не только отдельных чипов. Уже объявлены партнерства с Microsoft и Anthropic, что подтверждает интерес крупных игроков к новой архитектуре. Однако AMD предупреждает, что теоретические пиковые значения FLOPS не всегда отражают реальную производительность в задачах инференса, где критичны оптимизация ПО и задержки памяти.
Источник: Tom's Hardware ↗
