Инструменты21 августа 2026 г., 18:18 МСК🤖 Auto

NVIDIA DSX MaxLPS: как выжать 40% больше GPU из того же мегаватта

NVIDIA представила DSX MaxLPS — комплексное решение для оптимизации энергопотребления AI-фабрик. Технология позволяет увеличить плотность вычислений до 40% за счет динамического распределения мощности и перехода на охлаждение с температурой 45°C.

Баннер новости 6250

Проблема «застрявшей» мощности

Современные AI-фабрики упираются не в количество GPU, а в лимиты по энергии. Традиционный подход статического распределения мощности (static rack provisioning) приводит к неэффективности: дата-центры резервируют пиковое потребление для каждого стойки, даже если реальная нагрузка ниже. В результате до 40% потенциальной мощности остается неиспользованной («stranded capacity»), так как одна стойка не может одолжить энергию соседней.

По данным NVIDIA, в типичной AI-фабрике мощностью 100 МВт только 60 МВт доходят до вычислительных узлов. Остальное уходит на инфраструктуру, потери в стойках и операционные inefficiencies (чекпоинты, рестарты).

Решение: DSX MaxLPS и Dynamic Power Software

NVIDIA DSX MaxLPS (Maximum Land Power Shell) — это набор технологий, объединяющий чипы, термодизайн и софт. Ключевой компонент — Dynamic Power Software (DPS) (Developer Preview). DPS работает как непрерывная петля управления:

  • Собирает телеметрию с уровня GPU, стойки и группы.
  • Выявляет неиспользуемые мощности (headroom).
  • Динамически перераспределяет энергию между стойками в рамках заданных политик.

Это позволяет избежать ручного перепланирования при изменении нагрузки или аварийных ситуациях. Интеграция с DSX Exchange (открытая шина событий) связывает DPS с системами управления зданием и электросетями, учитывая внешние факторы, такие как сезонное охлаждение.

Результаты валидации на Vera Rubin и GB200

Технология протестирована на системах NVIDIA Vera Rubin NVL72 и GB200 NVL72. Внедрение MaxLPS дает следующие метрики:

Метрика Значение / Эффект
Увеличение емкости GPU До 40% больше GPU в том же физическом пространстве
Улучшение Performance per Watt В 1.3–1.5 раза выше эффективность
Температурный режим Охлаждение жидкостью до 45°C (снижает нагрузку на PUE)
Экономия мощности Возврат 170 кВт «застрявшей» мощности на примере 540 кВт бюджета

Профилирование нагрузки (WPPS)

Помимо распределения энергии, MaxLPS включает Workload Profile Power Solutions (WPPS). Это готовые профили питания для инференса, обучения и memory-bound задач. Менеджер APPM применяет эти настройки, а NVIDIA Dynamo оптимизирует межстойковое взаимодействие. Такой подход исключает необходимость тонкой настройки каждого задания вручную, обеспечивая стабильную производительность на фиксированном лимите мощности.

Почему это важно

Для операторов AI-фабрик MaxLPS означает возможность масштабировать вычислительные мощности без дорогостоящей модернизации электросетей и систем охлаждения. Переход от статического к динамическому управлению энергией становится критическим фактором рентабельности (ROI) при развертывании крупных моделей, где каждый ватт на счету.

Источник: NVIDIA dev blog ↗