AI-новости1 сентября 2026 г., 16:18 МСК🤖 Auto

NVIDIA Rubin CPX: HBM4 вместо GDDR7 для агентов ИИ

NVIDIA вернула к жизни утихомирленный ускоритель Rubin CPX, заменив память GDDR7 на 168 ГБ HBM4. Чип создан для разделения задач префилла и декодирования в LLM.

Баннер новости 6501

Возвращение с новой архитектурой памяти

Проект специализированного ускорителя Rubin CPX, ранее приостановленный, официально возобновлен. Как сообщает аналитик цепочек поставок Минг-Чи Куо, NVIDIA полностью переработала архитектуру памяти: вместо запланированных 128 ГБ GDDR7 теперь используется 168 ГБ HBM4. Это решение требует пересмотра упаковки чипа, вероятно, с использованием технологий TSMC CoWoS-S или CoWoS-L.

Специализация: префилл против декодирования

Ключевая инновация заключается в разделении вычислительных нагрузок для больших языковых моделей (LLM). Rubin CPX предназначен исключительно для задач префилла (prefill) и обработки контекста, в то время как стандартные GPU семейства Rubin берут на себя задачу декодирования (decode). Это позволяет оптимизировать пропускную способность и снизить задержки при работе с триллионными моделями.

Технические характеристики и производительность

Чип построен на монолитном кристалле и обеспечивает вычислительную мощность 30 PetaFLOPS в формате NVFP4. Для интеграции в мультимедийные рабочие процессы на кристалл также вынесены четыре энкодера NVENC и четыре декодера NVDEC. Рекомендуемая архитектура дата-центра предполагает соотношение 1:1 между GPU CPX и стандартными GPU в стойках декодирования.

Параметр Rubin CPX (Новая спецификация) Предыдущая спецификация
Тип памяти HBM4 GDDR7
Объем памяти 168 ГБ 128 ГБ
Вычислительная мощность 30 PetaFLOPS (NVFP4) Не указано
Встроенные кодеки 4x NVENC, 4x NVDEC Не указано
Назначение Префилл, KV cache Не указано

Масштабируемость и применение

Ускорители размещаются в отдельных стойках, конфигурации которых варьируются от 64 до 256 независимых GPU CPX на стойку. Одна стойка, содержащая 8 GPU CPX, способна обрабатывать 1.34 ТБ длинного контекста префилла. Использование быстрой памяти HBM4 критически важно для ускорения доставки токенов в агентах ИИ, где задержка на этапе префилла часто становится узким местом.

Источник: TechPowerUp ↗