Смена парадигмы: от пиковой производительности к токенам на ватт
На конференции AI Infra Summit в Санта-Кларе, собравшей более 8 000 участников, NVIDIA объявила о смене метрик эффективности для AI-инфраструктуры. Ключевым показателем теперь становится не пиковая производительность, а валидированные токены на мегаватт (tokens per megawatt) для агентных рабочих нагрузок. Это связано с тем, что агентный ИИ требует огромных объемов вычислений для цепочек рассуждений и вызовов инструментов, что делает энергоэффективность критическим фактором экономики дата-центров.
Результаты Lambda: 23% прирост эффективности с DSX MaxLPS
Облачный провайдер Lambda стал первым, кто протестировал технологию NVIDIA DSX MaxLPS на серверах Blackwell. Система динамически перераспределяет мощность между GPU и стойками, устраняя простои, характерные для статического распределения ресурсов. Результаты тестирования на смешанных нагрузках (обучение и инференс) показали значительный прогресс:
| Метрика | До оптимизации | После внедрения DSX MaxLPS | Прирост |
|---|---|---|---|
| Количество узлов в бюджете 16 мощных серверов | 16 | 19 | — |
| Пропускная способность кластера (токенов/сек) | ~4 млн | ~5 млн | +24% |
| Эффективность (производительность на ватт) | База | — | +23% |
Для будущих фабрик на базе NVIDIA Vera Rubin NVL72 технология DSX MaxLPS позволит увеличить количество GPU на 40% в рамках того же энергетического бюджета.
Vera Rubin NVL72 и Groq 3 LPX: 30x преимущество над GB200
Платформа NVIDIA Vera Rubin NVL72, объединяющая системы, сеть (NVLink, Spectrum-X) и управление питанием, демонстрирует рекордные результаты в бенчмарке SemiAnalysis AgentX. Этот тест имитирует реальные сессии агентного программирования с ростом контекста и вызовом под-агентов, что в 15 раз превышает объем данных обычного чата.
- Пропускная способность: На модели DeepSeek V4 Pro Vera Rubin NVL72 обеспечивает до 30x большей пропускной способности на ватт по сравнению с NVIDIA GB300 NVL72.
- Стоимость: Стоимость обработки миллиона токенов снизилась до 45 раз.
- Скорость инференса: В связке с Groq 3 LPX (для детерминированного инференса с низкой задержкой) платформа выдает до 2 529 выходных токенов в секунду на пользователя при контексте 100K (модель Qwen 3.8 27B). Это дает до 35x прироста токенов на ватт для моделей с 2+ триллионами параметров.
Гибкое управление сетью: партнерство с Emerald AI и Silicon Valley Power
NVIDIA также представила решение DSX Flex для управления энергопотреблением в зависимости от состояния энергосети. В партнерстве с Emerald AI и поставщиком электроэнергии Silicon Valley Power была продемонстрирована система, которая автоматически снижает нагрузку на ИИ-фабрики при сигналах от сети, сохраняя приоритетные рабочие нагрузки. Это позволяет дата-центрам участвовать в балансировке энергосети и «разблокировать» дополнительные мощности для роста ИИ-инфраструктуры без прокладки новых линий электропередач.
Экосистемные интеграции
Помимо собственных разработок, NVIDIA анонсировала ключевые партнерства:
- Amazon Annapurna Labs: совместная разработка кастомной технологии высокоскоростной памяти NVHBM.
- d-Matrix: интеграция платформы NVLink Fusion с их ускорителями Raptor XPUs.
- Pinterest: использование платформы Blackwell и ПО NVIDIA Dynamo для внедрения разговорного ИИ в визуальный поиск.
Источник: NVIDIA Blog ↗
