Релиз модели21 июля 2026 г., 19:00 МСК🤖 Auto

NVIDIA Vera Rubin: 10x рост эффективности и снижение стоимости токенов

NVIDIA начала массовое производство Vera Rubin NVL72. Платформа обеспечивает в 10 раз больше токенов на мегаватт по сравнению с Blackwell, снижая стоимость инференса и экономя воду за счет сухого охлаждения.

Баннер новости 4053

Массовое производство и масштабирование

Платформа NVIDIA Vera Rubin официально перешла в стадию массового производства. Серверные стойки Vera Rubin NVL72 уже развернуты у ключевых партнеров: CoreWeave, Google Cloud, Microsoft Azure и Oracle Cloud Infrastructure (OCI). Для обеспечения спроса NVIDIA задействовала цепочку поставок, охватывающую более 350 заводов в 30 странах — это самая зрелая и масштабная инфраструктура в истории компании.

Результаты бенчмарков: CoreWeave и DeepSeek-R1

Первые реальные метрики производительности опубликованы облачным провайдером CoreWeave. В тесте на модели DeepSeek-R1 (архитектура MoE, требующая интенсивного межсетевого взаимодействия) новая платформа показала прорывной результат. Ключевой метрикой стал показатель «токенов на мегаватт» (tokens per megawatt), который определяет экономическую эффективность AI-фабрик в условиях ограничений по энергии.

Метрика / Характеристика Vera Rubin NVL72 Grace Blackwell NVL72 Преимущество
Пропускная способность (токенов/сек/МВт) Базовый уровень Базовый уровень 10x рост
Стоимость токена (на 1 млн токенов) Базовый уровень Базовый уровень В 10 раз ниже
Пропускная способность NVLink (all-to-all) 260 TB/s Информация недостаточна Устранение узких мест MoE
Пропускная способность Ethernet (Spectrum-X) 1.6x выше Off-the-shelf Ethernet Более высокая пропускная способность RDMA

Экстремальный со-дизайн: 7 чипов как единая система

Производительность достигнута не за счет отдельных компонентов, а через глубокую интеграцию семи чипов и пяти поддонов стойки в единую систему. В центре архитектуры — новый NVIDIA Vera CPU с кастомным ядром Olympus. Он обеспечивает:

  • 2x однопоточную производительность;
  • 3x пропускную способность между ядрами;
  • 40% снижение задержки памяти по сравнению с чиплетными решениями конкурентов.

Для сетей используется шестое поколение NVLink (в 2 раза выше пропускная способность сложных задач, в 3 раза ниже задержка) и коммутаторы Spectrum-6 SPX с пропускной способностью 102.4T. Также внедрены оптические модули с ко-упакованной оптикой (co-packaged optics), которые снижают энергопотребление в 5 раз и увеличивают MTBI в 10 раз по сравнению с традиционными трансиверами.

Экология и эффективность: сухое охлаждение

Vera Rubin NVL72 спроектирована без кабелей, вентиляторов и шлангов внутри поддона, что сокращает время сборки с часов до одной минуты. Главная инновация — поддержка температуры входа жидкостного охлаждения до 45°C. Это позволяет использовать сухие охладители (dry-coolers) без чиллеров, эконогая миллионы галлонов воды на каждый мегаватт мощности ежегодно.

Европейский суверенный AI: партнерство Microsoft и Mistral

Платформа стала основой для расширения партнерства Microsoft и Mistral в Европе. Соглашение направлено на создание инфраструктуры, соответствующей европейским законам о данных и суверенитете. Mistral Medium 3.5 и OCR 4 уже доступны через Microsoft Foundry. Это решение позволяет государственным и регулируемым отраслям использовать передовой AI, сохраняя контроль над данными, при этом получая выгоду от 10-кратного роста эффективности по сравнению с предыдущим поколением GB200.

Источник: NVIDIA Blog ↗