AI-новости24 августа 2026 г., 01:17 МСК🤖 Auto

d-Matrix Raptor: 3D-DRAM ускоритель для LLM с пропускной способностью 100 ТБ/с

d-Matrix представила ускоритель Raptor на базе 3D-DRAM, решающий проблему узкого места памяти при генеративном выводе. Устройство обеспечивает 100 ТБ/с пропускной способности и позволяет разместить модели уровня Kimi K3 в одном стойко-месте.

Баннер новости 6348

Проблема: Разрыв между SRAM и HBM

При генеративном выводе (inference) ключевым узким местом становится не вычислительная мощность, а пропускная способность памяти, особенно в фазе декодирования (decode). d-Matrix анализирует текущие технологии:

  • SRAM: Обеспечивает ~300 ТБ/с при задержке 1 нс, но емкость всего ~4 ГБ. Слишком дорого и энергозатратно для весов больших моделей.
  • HBM4: Решает проблему емкости, но упирается в физический предел «пляжного фронта» (beachfront) пакета. Практический потолок — около 20 ТБ/с. При попытке выдать 100 ТБ/с через HBM энергопотребление только интерфейса составит ~1.92 кВт.

Решение: d-Matrix Raptor на 3D-DRAM

Компания предлагает промежуточное решение — стек вычислений поверх DRAM. Технология использует логический кристалл TSMC N4, расположенный поверх DRAM-кристалла методом face-to-face стэкинга (толщина соединения 36 мкм). Это позволяет достичь энергоэффективности 0.3–0.4 пДж/бит, что в 10 раз лучше, чем у 2.5D HBM.

Технические характеристики и производительность

Одна карта Raptor содержит 32 ГБ памяти. Система спроектирована так, чтобы размещать передовые модели (например, Kimi K3 с контекстом 1M токенов) в рамках одного rack-решения. Ниже приведено сравнение подходов к решению проблемы памяти:

Параметр SRAM (Corsair) HBM4 (NVIDIA/AMD) d-Matrix Raptor 3D-DRAM
Пропускная способность ~300 ТБ/с ~20 ТБ/с (практический лимит) ~100 ТБ/с
Энергоэффективность ~50 фДж/бит 2.5–5 пДж/бит 0.3–0.4 пДж/бит
Емкость (на чип/карту) ~4 ГБ Ограничена пакетами 32 ГБ (на карту)
Основной недостаток Малая емкость, утечки тока Низкая пропускная способность, высокое энергопотребление I/O Тепловые и надежность проблемы при 105°C

Инженерные вызовы и решения

Создание рабочей системы потребовало решения трех взаимосвязанных проблем:

  1. Маппинг банков (Bank Mapping): Неравномерное распределение данных приводило к перерасходу 33% пропускной способности. Решение: Stream Blocking — группировка данных позволяет использовать 100% колонок без сдвиговых буферов.
  2. Потребление энергии I/O: Передача 100 ТБ/с требует 296 Вт только на интерфейс. Решение: Stream Flipping (pinless DBI) — инверсия битов для минимизации переключений, что снижает энергопотребление на 20% без изменения PHY.
  3. Надежность при нагреве: При температуре 105°C время удержания данных падает с 32 мс до 4 мс, требуя частого обновления. Решение: Thermal-Aware Refresh с кодами Рида-Соломона. Затраты на обновление составляют всего 1.37%, а резервные банки (72 шт.) компенсируют дефекты кристалла.

Значение для индустрии

Представление Raptor на Hot Chips 2026 демонстрирует, что вертикальная интеграция памяти и вычислений может обойти физические ограничения плоских интерпозеров. Для дата-центров это означает возможность развертывания моделей с огромным контекстом (1M токенов) и высокой параллельностью (batch size) без необходимости в распределенных кластерах, экономя на сетевой инфраструктуре и задержках.

Источник: ServeTheHome ↗