Проблема «застрявшей» мощности
Современные AI-фабрики упираются не в количество GPU, а в лимиты по энергии. Традиционный подход статического распределения мощности (static rack provisioning) приводит к неэффективности: дата-центры резервируют пиковое потребление для каждого стойки, даже если реальная нагрузка ниже. В результате до 40% потенциальной мощности остается неиспользованной («stranded capacity»), так как одна стойка не может одолжить энергию соседней.
По данным NVIDIA, в типичной AI-фабрике мощностью 100 МВт только 60 МВт доходят до вычислительных узлов. Остальное уходит на инфраструктуру, потери в стойках и операционные inefficiencies (чекпоинты, рестарты).
Решение: DSX MaxLPS и Dynamic Power Software
NVIDIA DSX MaxLPS (Maximum Land Power Shell) — это набор технологий, объединяющий чипы, термодизайн и софт. Ключевой компонент — Dynamic Power Software (DPS) (Developer Preview). DPS работает как непрерывная петля управления:
- Собирает телеметрию с уровня GPU, стойки и группы.
- Выявляет неиспользуемые мощности (headroom).
- Динамически перераспределяет энергию между стойками в рамках заданных политик.
Это позволяет избежать ручного перепланирования при изменении нагрузки или аварийных ситуациях. Интеграция с DSX Exchange (открытая шина событий) связывает DPS с системами управления зданием и электросетями, учитывая внешние факторы, такие как сезонное охлаждение.
Результаты валидации на Vera Rubin и GB200
Технология протестирована на системах NVIDIA Vera Rubin NVL72 и GB200 NVL72. Внедрение MaxLPS дает следующие метрики:
| Метрика | Значение / Эффект |
|---|---|
| Увеличение емкости GPU | До 40% больше GPU в том же физическом пространстве |
| Улучшение Performance per Watt | В 1.3–1.5 раза выше эффективность |
| Температурный режим | Охлаждение жидкостью до 45°C (снижает нагрузку на PUE) |
| Экономия мощности | Возврат 170 кВт «застрявшей» мощности на примере 540 кВт бюджета |
Профилирование нагрузки (WPPS)
Помимо распределения энергии, MaxLPS включает Workload Profile Power Solutions (WPPS). Это готовые профили питания для инференса, обучения и memory-bound задач. Менеджер APPM применяет эти настройки, а NVIDIA Dynamo оптимизирует межстойковое взаимодействие. Такой подход исключает необходимость тонкой настройки каждого задания вручную, обеспечивая стабильную производительность на фиксированном лимите мощности.
Почему это важно
Для операторов AI-фабрик MaxLPS означает возможность масштабировать вычислительные мощности без дорогостоящей модернизации электросетей и систем охлаждения. Переход от статического к динамическому управлению энергией становится критическим фактором рентабельности (ROI) при развертывании крупных моделей, где каждый ватт на счету.
Источник: NVIDIA dev blog ↗
