Релиз модели15 сентября 2026 г., 20:03 МСК🤖 Auto

NVIDIA Vera Rubin: 30x рост эффективности AI-фабрик и новый стандарт токенов на ватт

На AI Infra Summit NVIDIA представила платформу Vera Rubin NVL72 и ПО DSX MaxLPS, обеспечивающие до 30-кратного роста пропускной способности агентов на ватт и оптимизацию энергопотребления дата-центров.

Баннер новости 7556

Смена парадигмы: от пиковой производительности к токенам на ватт

На конференции AI Infra Summit в Санта-Кларе, собравшей более 8 000 участников, NVIDIA объявила о смене метрик эффективности для AI-инфраструктуры. Ключевым показателем теперь становится не пиковая производительность, а валидированные токены на мегаватт (tokens per megawatt) для агентных рабочих нагрузок. Это связано с тем, что агентный ИИ требует огромных объемов вычислений для цепочек рассуждений и вызовов инструментов, что делает энергоэффективность критическим фактором экономики дата-центров.

Результаты Lambda: 23% прирост эффективности с DSX MaxLPS

Облачный провайдер Lambda стал первым, кто протестировал технологию NVIDIA DSX MaxLPS на серверах Blackwell. Система динамически перераспределяет мощность между GPU и стойками, устраняя простои, характерные для статического распределения ресурсов. Результаты тестирования на смешанных нагрузках (обучение и инференс) показали значительный прогресс:

Метрика До оптимизации После внедрения DSX MaxLPS Прирост
Количество узлов в бюджете 16 мощных серверов 16 19
Пропускная способность кластера (токенов/сек) ~4 млн ~5 млн +24%
Эффективность (производительность на ватт) База +23%

Для будущих фабрик на базе NVIDIA Vera Rubin NVL72 технология DSX MaxLPS позволит увеличить количество GPU на 40% в рамках того же энергетического бюджета.

Vera Rubin NVL72 и Groq 3 LPX: 30x преимущество над GB200

Платформа NVIDIA Vera Rubin NVL72, объединяющая системы, сеть (NVLink, Spectrum-X) и управление питанием, демонстрирует рекордные результаты в бенчмарке SemiAnalysis AgentX. Этот тест имитирует реальные сессии агентного программирования с ростом контекста и вызовом под-агентов, что в 15 раз превышает объем данных обычного чата.

  • Пропускная способность: На модели DeepSeek V4 Pro Vera Rubin NVL72 обеспечивает до 30x большей пропускной способности на ватт по сравнению с NVIDIA GB300 NVL72.
  • Стоимость: Стоимость обработки миллиона токенов снизилась до 45 раз.
  • Скорость инференса: В связке с Groq 3 LPX (для детерминированного инференса с низкой задержкой) платформа выдает до 2 529 выходных токенов в секунду на пользователя при контексте 100K (модель Qwen 3.8 27B). Это дает до 35x прироста токенов на ватт для моделей с 2+ триллионами параметров.

Гибкое управление сетью: партнерство с Emerald AI и Silicon Valley Power

NVIDIA также представила решение DSX Flex для управления энергопотреблением в зависимости от состояния энергосети. В партнерстве с Emerald AI и поставщиком электроэнергии Silicon Valley Power была продемонстрирована система, которая автоматически снижает нагрузку на ИИ-фабрики при сигналах от сети, сохраняя приоритетные рабочие нагрузки. Это позволяет дата-центрам участвовать в балансировке энергосети и «разблокировать» дополнительные мощности для роста ИИ-инфраструктуры без прокладки новых линий электропередач.

Экосистемные интеграции

Помимо собственных разработок, NVIDIA анонсировала ключевые партнерства:

  • Amazon Annapurna Labs: совместная разработка кастомной технологии высокоскоростной памяти NVHBM.
  • d-Matrix: интеграция платформы NVLink Fusion с их ускорителями Raptor XPUs.
  • Pinterest: использование платформы Blackwell и ПО NVIDIA Dynamo для внедрения разговорного ИИ в визуальный поиск.

Источник: NVIDIA Blog ↗