Главная/Блог/Аналитика/Архитектура NVIDIA Rubin: Двигатель эры…
Аналитика10 мин чтения · 21 июля 2026 г.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

Разбираем архитектуру GPU NVIDIA Rubin: как 336 млрд транзисторов, память HBM4 и новые алгоритмы сжатия обеспечивают 10-кратный рост эффективности для агентных ИИ-систем.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

Эра искусственного интеллекта, начавшаяся с простых чат-ботов и генерации изображений, вступает в новую, более сложную фазу. Мы переходим от статичных моделей, отвечающих на один запрос, к динамичным «ИИ-фабрикам», которые работают круглосуточно, рассуждают, планируют действия, используют внешние инструменты и верифицируют промежуточные результаты. Эти агентные рабочие процессы (agentic workflows) требуют совершенно иного подхода к вычислениям: низких задержек на каждом шаге, высокой пропускной способности декодирования и способности обрабатывать огромные контексты без потери скорости. Именно для решения этих задач NVIDIA представила архитектуру Rubin — сердце новой платформы Vera Rubin, которая обещает стать стандартом для масштабного развертывания сложных ИИ-агентов.

В отличие от предыдущих поколений, ориентированных преимущественно на обучение или базовый вывод, Rubin спроектирован с нуля для оптимизации именно агентных нагрузок. Архитектура предлагает до 10-кратного увеличения пропускной способности агентов на единицу потребленной энергии по сравнению с Blackwell. Это достигается за счет беспрецедентной плотности вычислений, интеграции новой памяти HBM4, третьего поколения Transformer Engine и инновационных механизмов управления данными. В этой статье мы подробно разберем, как технически реализованы эти преимущества, какие проблемы решают новые блоки GPU и что это значит для разработчиков и дата-центров будущего.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

01Фундамент архитектуры: От транзисторов к Streaming Multiprocessors

В основе NVIDIA Rubin лежит подход к проектированию, учитывающий физические ограничения производства. GPU состоит из двух вычислительных кристаллов (compute dies), объединенных в единую упаковку с помощью высокоскоростного интерфейса NVIDIA High-Bandwidth Interface (NV-HBI). Это решение позволяет достичь высокой плотности вычислений, преодолевая ограничения размера одного кристалла (reticle limit), сохраняя при этом эффективность и производительность.

Цифры, стоящие за этой архитектурой, впечатляют: 336 миллиардов транзисторов, распределенных по 224 Streaming Multiprocessors (SM) и 896 Tensor Cores. Однако сырая мощность — лишь половина дела. Ключевая особенность Rubin заключается в гибкости точности вычислений. Третье поколение Transformer Engine позволяет динамически адаптировать точность между различными числовыми форматами. Это не просто экономия ресурсов, а способ сохранить точность моделей при одновременном достижении пиковой производительности до 50 петафлопс в формате NVFP4. Такая гибкость критически важна для агентов, которые могут переключаться между этапами строгого логического вывода (требующими высокой точности) и этапами генерации текста (где допустима более низкая точность для скорости).

Архитектура организована вокруг Graphics Processor Clusters (GPC), которые содержат большой централизованный кэш второго уровня (L2). Это решает одну из главных проблем современных GPU — «голод» вычислительных блоков по данным. GigaThread Engine координирует распределение задач, а MIG Control позволяет эффективно разделять GPU для работы с несколькими нагрузками одновременно. В сочетании с ускорителем декодирования NV-DEC, эта структура превращает сырую плотность транзисторов в устойчивую утилизацию ресурсов, что особенно важно для динамичных агентных систем, где нагрузка постоянно меняется.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

02Память и пропускная способность: Эра HBM4

В эпоху больших языковых моделей (LLM) и агентов, которые работают с длинными контекстами, память часто становится узким местом. Фаза декодирования (генерации токенов) фундаментально ограничена подсистемой памяти, а не пиковой мощностью процессора. NVIDIA Rubin решает эту проблему, внедряя память нового поколения — HBM4.

GPU Rubin поддерживает до 288 ГБ памяти HBM4, что является значительным скачком по сравнению с предыдущими поколениями. Но главное не только в объеме, но и в скорости. Благодаря новым контроллерам памяти и стекам 12-Hi, архитектура обеспечивает пиковую пропускную способность до 22 ТБ/с. Это в 2,8 раза больше, чем у Blackwell и Blackwell Ultra. Такая пропускная способность необходима для того, чтобы поддерживать вычислительные ядра в активном состоянии во время генерации токенов, когда модели weights и состояние KV-кэша должны перемещаться с невероятной скоростью.

Объем и пропускная способность играют разные, но взаимодополняющие роли. Большой объем (288 ГБ) позволяет размещать в памяти модели с триллионами параметров, увеличивать размер контекстного окна и хранить огромные KV-кэши для множества одновременных пользователей без необходимости выгружать данные во внешнюю память. Высокая пропускная способность (22 ТБ/с) обеспечивает скорость, необходимую для пошаговой генерации, где каждый следующий токен зависит от предыдущих. Улучшенный Tensor Memory Accelerator (TMA) управляет перемещением данных через сложные структуры, гарантируя, что программное обеспечение может эффективно использовать эту мощь даже при нестандартных layouts данных.

03Оптимизация Mixture-of-Experts (MoE): Встроенные дескрипторы

Современные эффективные модели часто используют архитектуру Mixture-of-Experts (MoE), где токены динамически маршрутизируются через различные «экспертные» сети. По мере роста числа экспертов, эффективность поиска и перемещения весов становится критической. Традиционные подходы требуют постоянного обновления дескрипторов памяти в оперативной памяти, что создает накладные расходы.

Rubin вводит поддержку inline descriptor updates (встроенного обновления дескрипторов) для TMA. Вместо того чтобы модифицировать дескриптор в памяти, ядро может использовать один унифицированный дескриптор для тензоров с общей структурой и переопределять поля, такие как указатель памяти и шаг (stride), непосредственно в инструкции TMA во время выполнения. Это радикально упрощает управление метаданными и снижает накладные расходы на перемещение данных, позволяя уделю больше времени полезным вычислениям. Для агентов, использующих крупные MoE-модели, это означает более высокую пропускную способность и меньшую задержку.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

04Ускорение матричных операций: Двойная эффективность K-измерения

Еще одно ключевое улучшение касается Tensor Cores. Rubin удваивает пропускную способность Tensor Core за такт, удваивая количество обрабатываемых данных вдоль измерения K. В матричных умножениях (GEMM), которые лежат в основе нейронных сетей, это означает, что операция, требующая четырех итераций на Blackwell, может быть выполнена за две итерации на Rubin.

Преимущество большего измерения K заключается в сокращении количества итераций цикла. Меньше итераций — меньше накладных расходов на управление циклом, выше утилизация Tensor Core и более эффективная работа как для ограниченных пропускной способностью, так и для ограниченных задержкой ядер. Это особенно важно при масштабировании модели на множество GPU, где каждый чип обрабатывает меньшую часть выходных данных, но размер измерений остается большим. Такая оптимизация помогает как контекстным, так и декодирующим GEMM работать эффективнее на высоких уровнях тензорного параллелизма.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

05Работа с длинным контекстом: Активационная разреженность и сжатие

Агентные ИИ часто работают с огромными контекстными окнами, что создает колоссальную нагрузку на механизм внимания (attention). Чем больше токенов, тем больше вычислений требуется для нормализации матриц внимания и применения весов к данным значений. Rubin атакует эту проблему с помощью активационной разреженности (activation sparsity) и адаптивного сжатия.

Механизм работает следующим образом: после вычисления промежуточных оценок внимания, данные загружаются из тензорной памяти в структурированный сжатый формат 2:4. Это генерирует как ненулевые значения, так и метаданные, необходимые для их эффективного использования, значительно снижая стоимость записи и требования к хранению. Последующие этапы внимания (softmax и второе матричное умножение) работают с меньшим объемом данных, сохраняя при этом плотный формат вывода, ожидаемый остальной частью модели.

Кроме того, Rubin значительно увеличивает пропускную способность экспоненциальных вычислений, необходимых для softmax. По сравнению с Blackwell, пропускная способность FP32 увеличена в 2 раза, а BF16/FP16 — в 4 раза. Это позволяет softmax «успевать» за более быстрыми матричными операциями, устраняя узкие места в конвейере обработки длинного контекста. В результате улучшается отношение токенов на ватт без необходимости изменять интерфейс вокруг модели.

Архитектура NVIDIA Rubin: Двигатель эры агентного ИИ

06Связь и коммуникация: NVLink 6 и fused communication

При масштабировании от одного GPU до целой стойки (rack-scale) коммуникации становятся частью критического пути производительности. Rubin вводит NVLink 6, обеспечивающий пропускную способность масштабирования (scale-up) до 3,6 ТБ/с для связи GPU-GPU через NVLink Switch. Для когерентной связи CPU-GPU используется NVLink-C2C со скоростью 1,8 ТБ/с, а PCIe Gen 6 обеспечивает до 256 ГБ/с для подключения хоста.

Важнейшим нововведением является counted writes (записи с подсчетом) для инициируемых устройством коммуникаций NVLink. Это позволяет принимающему GPU более эффективно отслеживать завершение передачи данных, устраняя необходимость в сложной синхронизации между CPU и GPU. Когда коммуникация «вплетена» (fused) непосредственно в ядро GPU, процессор не останавливается для передачи управления CPU, а напрямую записывает данные или выполняет редукции через NVLink, пока вычисления все еще находятся в полете. Это снижает задержку и сохраняет пропускную способность интерконнекта для полезной работы.

Тонкая координация ядер (Fine-grained Kernel Triggering)

В традиционных сценариях «производитель-потребитель» (producer-consumer) могут возникать простои: ядро-потребитель ждет, пока ядро-производитель завершит работу со всем блоком данных, даже если необходимые для начала работы данные уже готовы. Rubin вводит триггеринг на уровне тайлов (tile-level triggering). Это позволяет ядру-потребителю начинать работу раньше, как только становятся доступными требуемые входные данные, а не ждать завершения всей работы производителя. Результатом является более плотно упакованное время выполнения GPU, уменьшение «пузырей» простоя и улучшенное перекрытие зависимых ядер, что критически важно для агентов, где задержка между ядрами напрямую влияет на скорость генерации токенов.

💡
Ключевое преимущество для разработчиков. Архитектура Rubin не требует полной переписи кода для получения выгоды. Многие оптимизации, такие как inline descriptor updates и activation sparsity, интегрированы на уровне драйверов и библиотек (например, cuBLAS, cuDNN), позволяя существующим моделям MoE и attention-механизмам работать быстрее «из коробки» при обновлении ПО.

07Масштабирование на уровне стойки: Vera Rubin NVL72

Мощность одного GPU раскрывается полностью только в масштабе. Платформа NVIDIA Vera Rubin NVL72 представляет собой систему, объединяющую 72 GPU в единую вычислительную единицу. Эта архитектура решает проблемы охлаждения, питания и надежности.

Используется жидкостное охлаждение и технология DSX MaxLPS для сглаживания пиков энергопотребления, что позволяет размещать до 40% больше GPU в том же энергетическом бюджете. Архитектура MGX без кабелей (cable-free) и горячая замена (hot-swappable) модулей коммутатора NVLink обеспечивают высокую отказоустойчивость и упрощают обслуживание. Такая интеграция позволяет запускать модели с триллионами параметров, которые ранее были невозможны для развертывания в масштабах предприятия.

⚠️
Важно для инфраструктуры. Переход на HBM4 и новые стандарты питания требует пересмотра инфраструктуры дата-центров. Однако NVIDIA предлагает комплексные решения, включая системы сглаживания питания, что делает интеграцию Vera Rubin более предсказуемой для существующих центров обработки данных, готовых к переходу на агентный ИИ.

08Безопасность: Confidential Computing

В эпоху агентов, которые могут обращаться к конфиденциальным данным и инструментам, безопасность становится не менее важной, чем производительность. Rubin интегрирует Confidential Computing с TEE-I/O (Trusted Execution Environment I/O). Эта технология защищает данные в состоянии покоя, во время передачи и использования внутри всей «ИИ-фабрики». Это гарантирует, что даже если физический доступ к серверу скомпрометирован, данные и модели остаются защищенными, что критически важно для корпоративных и государственных применений агентного ИИ.

09Что это значит на практике

Для разработчиков и компаний, внедряющих ИИ, архитектура NVIDIA Rubin означает сдвиг парадигмы от «возможности запустить модель» к «эффективности работы модели в реальном времени».

  1. Агенты становятся реальностью: Благодаря 10-кратному росту эффективности на ватт и оптимизации для длинных контекстов, агенты, которые раньше были слишком дороги или медленны для массового использования, теперь могут работать в реальном времени. Это открывает двери для персонализированных помощников, которые помнят всю историю взаимодействия и могут выполнять сложные многошаговые задачи.
  2. Экономическая эффективность: Увеличение пропускной способности памяти и оптимизация перемещения данных (MoE, TMA) снижают стоимость каждого сгенерированного токена. Это делает масштабирование ИИ-сервисов более рентабельным.
  3. Упрощение масштабирования: Интеграция коммуникаций в ядра GPU и улучшенная координация между ядрами снижают сложность распределенных вычислений. Разработчикам нужно меньше заниматься оптимизацией сетевого взаимодействия, так как архитектура берет эту работу на себя.

В заключение, NVIDIA Rubin — это не просто эволюция, а революция в дизайне GPU, специально заточенная под требования следующего поколения ИИ. Сочетание мощной вычислительной плотности, революционной памяти HBM4, инновационных методов сжатия и безопасной, высокопроизводительной связи делает эту архитектуру фундаментом для эры автономных, рассуждающих ИИ-агентов.

📌
Факт. Платформа Vera Rubin с GPU Rubin позиционируется как решение для «ИИ-фабрик», способных обрабатывать непрерывные потоки данных и задач, что отличает ее от предыдущих поколений, оптимизированных преимущественно под пакетную обработку (batch processing).

Источник: NVIDIA Developer ↗