Суть инновации: узкий интерфейс вместо широкого
Комитет JEDEC опубликовал спецификацию SPHBM4 (Standard Package High Bandwidth Memory, JESD330-4). Ключевое отличие от классического HBM4 — использование 512-битного узкого интерфейса вместо стандартных 1024/2048 бит. Это достигается за счет новой базовой микросхемы (base die) с PHY/буфером, которая конвертирует внутренние 32 канала HBM4 (по 64 бита) в 8 независимых Quad-каналов DDR (по 16 бит).
Для компенсации сужения шины скорость передачи данных увеличена до 22.4–46.0 GT/s. При этом ядро DRAM остается неизменным: частота ядра составляет 1/4 от частоты интерфейса (например, 2 ГГц при скорости 32 GT/s), что сохраняет архитектуру и тайминги оригинального HBM4.
Технические характеристики и сравнение
Отказ от кремниевых интерпозеров открывает путь к использованию более дешевых органических подложек. Ниже приведено сравнение ключевых параметров:
| Параметр | HBM4 (Standard) | SPHBM4 (New Standard) |
|---|---|---|
| Ширина интерфейса | 2048 бит (внешний) | 512 бит (внешний) |
| Скорость передачи (GT/s) | 8–12.8 (HBM4E) | 22.4 – 46.0 |
| Пиковая пропускная способность | до 3.3 ТБ/с (HBM4E) | до 2.944 ТБ/с |
| Тип подложки | Кремниевый интерпозер (CoWoS) | Органическая подложка |
| Шаг бампов (Bump pitch) | Менее 90 мкм | Более 90 мкм |
| Макс. емкость стека | 64 ГБ (16 чипов по 32 Гб) | 64 ГБ (16 чипов по 32 Гб) |
Зачем это нужно: стоимость и доступность
Основная цель SPHBM4 — снижение стоимости внедрения HBM. Стандарт допускает шаг бампов более 90 мкм и длину каналов до 20 мм, что критически важно для органических подложек. Однако это не делает память «дешевой» в абсолютном выражении: стеки HBM4, TSV-технологии и сложная базовая микросхема с SerDes-физическим уровнем остаются дорогими компонентами.
Главное преимущество — экономия площади кристалла процессора. Узкий интерфейс занимает меньше места, позволяя размещать больше вычислительных блоков или стеков памяти вокруг чипа, что особенно важно для производителей, ограниченных в доступе к передовым техпроцессам упаковки.
Компромиссы: задержка и энергопотребление
Новый стандарт вносит свои ограничения. Сложный PHY-контроллер, отвечающий за сериализацию, коррекцию ошибок (FEC) и тренировку линий, добавляет несколько наносекунд задержки по сравнению с прямым подключением HBM4. Это может негативно сказаться на задачах инференса, чувствительных к latency.
Энергоэффективность I/O также под вопросом: передача данных на высоких скоростях (до 46 GT/s) менее эффективна, чем широкая параллельная шина HBM4. Хотя количество драйверов снижается в 4 раза, общая мощность системы зависит от эффективности нового PHY. Напряжение I/O стандартизировано на уровне 0.75 В.
Геополитический аспект: шанс для Китая
SPHBM4 представляет особый интерес для китайских разработчиков ИИ-ускорителей (Biren, Huawei и др.). Ограничения на доступ к передовым технологиям упаковки (например, CoWoS от TSMC) делают органические подложки более реалистичной альтернативой. Если китайские производители смогут наладить выпуск сложных базовых микросхем с SerDes, SPHBM4 позволит им интегрировать HBM-память в свои ускорители без зависимости от западных технологий 2.5D-интеграции.
Источник: Tom's Hardware ↗
