Проблема: Разрыв между SRAM и HBM
При генеративном выводе (inference) ключевым узким местом становится не вычислительная мощность, а пропускная способность памяти, особенно в фазе декодирования (decode). d-Matrix анализирует текущие технологии:
- SRAM: Обеспечивает ~300 ТБ/с при задержке 1 нс, но емкость всего ~4 ГБ. Слишком дорого и энергозатратно для весов больших моделей.
- HBM4: Решает проблему емкости, но упирается в физический предел «пляжного фронта» (beachfront) пакета. Практический потолок — около 20 ТБ/с. При попытке выдать 100 ТБ/с через HBM энергопотребление только интерфейса составит ~1.92 кВт.
Решение: d-Matrix Raptor на 3D-DRAM
Компания предлагает промежуточное решение — стек вычислений поверх DRAM. Технология использует логический кристалл TSMC N4, расположенный поверх DRAM-кристалла методом face-to-face стэкинга (толщина соединения 36 мкм). Это позволяет достичь энергоэффективности 0.3–0.4 пДж/бит, что в 10 раз лучше, чем у 2.5D HBM.
Технические характеристики и производительность
Одна карта Raptor содержит 32 ГБ памяти. Система спроектирована так, чтобы размещать передовые модели (например, Kimi K3 с контекстом 1M токенов) в рамках одного rack-решения. Ниже приведено сравнение подходов к решению проблемы памяти:
| Параметр | SRAM (Corsair) | HBM4 (NVIDIA/AMD) | d-Matrix Raptor 3D-DRAM |
|---|---|---|---|
| Пропускная способность | ~300 ТБ/с | ~20 ТБ/с (практический лимит) | ~100 ТБ/с |
| Энергоэффективность | ~50 фДж/бит | 2.5–5 пДж/бит | 0.3–0.4 пДж/бит |
| Емкость (на чип/карту) | ~4 ГБ | Ограничена пакетами | 32 ГБ (на карту) |
| Основной недостаток | Малая емкость, утечки тока | Низкая пропускная способность, высокое энергопотребление I/O | Тепловые и надежность проблемы при 105°C |
Инженерные вызовы и решения
Создание рабочей системы потребовало решения трех взаимосвязанных проблем:
- Маппинг банков (Bank Mapping): Неравномерное распределение данных приводило к перерасходу 33% пропускной способности. Решение: Stream Blocking — группировка данных позволяет использовать 100% колонок без сдвиговых буферов.
- Потребление энергии I/O: Передача 100 ТБ/с требует 296 Вт только на интерфейс. Решение: Stream Flipping (pinless DBI) — инверсия битов для минимизации переключений, что снижает энергопотребление на 20% без изменения PHY.
- Надежность при нагреве: При температуре 105°C время удержания данных падает с 32 мс до 4 мс, требуя частого обновления. Решение: Thermal-Aware Refresh с кодами Рида-Соломона. Затраты на обновление составляют всего 1.37%, а резервные банки (72 шт.) компенсируют дефекты кристалла.
Значение для индустрии
Представление Raptor на Hot Chips 2026 демонстрирует, что вертикальная интеграция памяти и вычислений может обойти физические ограничения плоских интерпозеров. Для дата-центров это означает возможность развертывания моделей с огромным контекстом (1M токенов) и высокой параллельностью (batch size) без необходимости в распределенных кластерах, экономя на сетевой инфраструктуре и задержках.
Источник: ServeTheHome ↗
