Возвращение с новой архитектурой памяти
Проект специализированного ускорителя Rubin CPX, ранее приостановленный, официально возобновлен. Как сообщает аналитик цепочек поставок Минг-Чи Куо, NVIDIA полностью переработала архитектуру памяти: вместо запланированных 128 ГБ GDDR7 теперь используется 168 ГБ HBM4. Это решение требует пересмотра упаковки чипа, вероятно, с использованием технологий TSMC CoWoS-S или CoWoS-L.
Специализация: префилл против декодирования
Ключевая инновация заключается в разделении вычислительных нагрузок для больших языковых моделей (LLM). Rubin CPX предназначен исключительно для задач префилла (prefill) и обработки контекста, в то время как стандартные GPU семейства Rubin берут на себя задачу декодирования (decode). Это позволяет оптимизировать пропускную способность и снизить задержки при работе с триллионными моделями.
Технические характеристики и производительность
Чип построен на монолитном кристалле и обеспечивает вычислительную мощность 30 PetaFLOPS в формате NVFP4. Для интеграции в мультимедийные рабочие процессы на кристалл также вынесены четыре энкодера NVENC и четыре декодера NVDEC. Рекомендуемая архитектура дата-центра предполагает соотношение 1:1 между GPU CPX и стандартными GPU в стойках декодирования.
| Параметр | Rubin CPX (Новая спецификация) | Предыдущая спецификация |
|---|---|---|
| Тип памяти | HBM4 | GDDR7 |
| Объем памяти | 168 ГБ | 128 ГБ |
| Вычислительная мощность | 30 PetaFLOPS (NVFP4) | Не указано |
| Встроенные кодеки | 4x NVENC, 4x NVDEC | Не указано |
| Назначение | Префилл, KV cache | Не указано |
Масштабируемость и применение
Ускорители размещаются в отдельных стойках, конфигурации которых варьируются от 64 до 256 независимых GPU CPX на стойку. Одна стойка, содержащая 8 GPU CPX, способна обрабатывать 1.34 ТБ длинного контекста префилла. Использование быстрой памяти HBM4 критически важно для ускорения доставки токенов в агентах ИИ, где задержка на этапе префилла часто становится узким местом.
Источник: TechPowerUp ↗
