AI-новости21 июля 2026 г., 19:30 МСК🤖 Auto

NVIDIA Rubin: 10x рост эффективности Agentic AI на базе HBM4 и 336 млрд транзисторов

NVIDIA представила архитектуру Rubin для платформы Vera Rubin, обещающую десятикратный прирост пропускной способности агентов ИИ на единицу энергии. Ключевые инновации: память HBM4, 224 SM и оптимизация MoE.

Баннер новости 4057

Новый стандарт эффективности: от Blackwell к Rubin

NVIDIA официально представила архитектуру GPU Rubin, ставшую сердцем новой вычислительной платформы Vera Rubin. Главная цель — поддержка эпохи Agentic AI, где модели не просто отвечают на запросы, а самостоятельно планируют, используют инструменты и выполняют многошаговые задачи. В отличие от предыдущего поколения Blackwell, Rubin обеспечивает до 10-кратного увеличения пропускной способности агентов на единицу потребленной энергии. Это достигается за счет перехода к более плотной интеграции и специализированным оптимизациям для длительных контекстов и смешанных экспертных моделей (MoE).

Железо: 336 млрд транзисторов и революция памяти

Архитектура Rubin построена на двух кристаллах, объединенных через высокоскоростной интерфейс NV-HBI. Общая плотность составляет 336 миллиардов транзисторов. Ключевым отличием от предшественников стала интеграция памяти нового поколения:

  • Объем: до 288 ГБ HBM4 (High Bandwidth Memory 4).
  • Пропускная способность: 22 ТБ/с (терабайта в секунду).
  • Вычислительная мощность: 224 Streaming Multiprocessors (SM) и 896 Tensor Cores.
  • Производительность: до 50 петафлопс в формате NVFP4 благодаря третьему поколению Transformer Engine.

Оптимизация Agentic-нагрузок: MoE и Long-Context

Агентные задачи требуют низкой задержки на каждом шаге рассуждения. NVIDIA внедрила несколько архитектурных улучшений для устранения узких мест:

  1. Inline Descriptor Updates: Улучшенный Tensor Memory Accelerator (TMA) позволяет обновлять дескрипторы прямо в инструкции, что критически важно для масштабирования MoE-моделей с большим количеством экспертов.
  2. Двойная эффективность GEMM: Увеличение пропускной способности по измерению K вдвое снижает количество итераций циклов, повышая утилизацию Tensor Core для матричных операций.
  3. Активационная разреженность и адаптивное сжатие: Технологии минимизируют задержки при переходах между ядрами и оптимизируют работу с длинными контекстами.

Масштабирование: Vera Rubin NVL72

На уровне стойки платформа Vera Rubin NVL72 использует жидкостное охлаждение и архитектуру MGX без кабелей. Система поддерживает сглаживание питания (DSX MaxLPS) и позволяет разместить до 40% больше GPU в том же энергетическом бюджете по сравнению с предыдущими решениями, обеспечивая отказоустойчивость и высокую пропускную способность для моделей с триллионами параметров.

Сравнение ключевых характеристик

Параметр NVIDIA Blackwell NVIDIA Rubin
Транзисторы (общие) ~141 млрд (B200) 336 млрд
Память HBM3e HBM4 (288 ГБ)
Пропускная способность памяти ~4.8 ТБ/с (на чип) 22 ТБ/с
Производительность Tensor Cores Высокая (FP4/FP8) До 50 PFLOPS (NVFP4)
Рост эффективности Agentic AI База До 10x (на единицу энергии)

Источник: NVIDIA dev blog ↗