В эпоху больших языковых моделей (LLM) и генеративного искусственного интеллекта парадигма проектирования дата-центров претерпела фундаментальные изменения. Раньше вопрос стоял в том, сколько серверов можно физически разместить в зале. Сегодня, когда масштабирование ИИ-инфраструктуры упирается не в площадь, а в доступную электрическую мощность, главный вопрос звучит иначе: сколько ИИ-вывода (tokens) может быть сгенерировано на каждый доступный мегаватт электроэнергии? Для операторов ИИ-фабрик, которые управляют огромными кластерами GPU, эффективность становится не просто метрикой оптимизации, а ключевым драйвером рентабельности бизнеса. Каждый неэффективно потраченный ватт — это упущенная прибыль, каждый не использованный киловатт-час — это потерянная возможность масштабировать сервис.
Компания NVIDIA представила решение, которое кардинально меняет подход к управлению энергией в таких масштабах. Технология NVIDIA DSX MaxLPS (Maximum Land Power Shell) — это не просто программный патч, а комплексная архитектура, объединяющая чипы, системы охлаждения, оборудование и программное обеспечение. Ее цель — максимизировать пропускную способность ИИ-фабрики в рамках жестких ограничений по мощности, которые диктуются землей, подключением к электросетям и физическими границами здания. В этой статье мы подробно разберем, как работает эта система, почему статическое распределение питания устарело и как внедрение динамического управления позволяет увеличить плотность вычислений на 40% без расширения инфраструктуры.
01Почему статическое распределение питания «замораживает» мощность
Традиционный подход к проектированию дата-центров основан на статическом распределении питания. Инженеры рассчитывают пиковое потребление каждого стойки (rack) и резервируют именно столько энергии для нее, предполагая, что все стойки могут одновременно потреблять максимум. Это создает иллюзию безопасности, но на практике приводит к огромным потерям. Стойка, работающая в фоновом режиме или выполняющая задачу с низкой нагрузкой, не может передать свой неиспользованный запас энергии соседней стойке, которая находится в пиковой фазе вычислений. Каждая стойка становится изолированным «энергетическим островом».
Давайте рассмотрим это на примере ИИ-фабрики мощностью 100 МВт. Согласно анализу NVIDIA, из этих 100 МВт только около 60 МВт в конечном итоге доходят до вычислительных блоков (GPU) для генерации полезной нагрузки. Остальная часть «съедается» инфраструктурными потерями:
- 20 МВт уходит на общие нужды дата-центра (освещение, системы безопасности, вспомогательное оборудование).
- 10 МВт теряется в распределительных сетях и трансформаторах на уровне стоек.
- 10 МВт недоступны для полезной нагрузки из-за операционных неэффективностей: простоев во время сбоев, перезагрузок, создания контрольных точек (checkpoints) и синхронизации.
Остается 60 МВт для самих ИИ-вычислений. Но даже внутри этих 60 МВт есть скрытый потенциал. Статическое резервирование означает, что если одна стойка потребляет только 70% от выделенных ей 100 кВт, остальные 30 кВт «висят мертвым грузом», пока другая стойка может нуждаться в дополнительной мощности для ускорения обучения модели. Именно этот «застрявший» (stranded) потенциал и пытается вернуть технология MaxLPS.

02Как работает динамическое распределение питания (DPS)
Сердцем решения MaxLPS является программное обеспечение Dynamic Power Software (DPS), находящееся в стадии Developer Preview. DPS заменяет статические настройки на непрерывный цикл управления. Система моделирует топологию дата-центра от уровня электросети до отдельных GPU, позволяя операторам определять группы ресурсов, бюджеты питания и политики распределения.
Процесс работы DPS можно описать как непрерывный контур управления:
- Сбор телеметрии: Система в реальном времени собирает данные о потреблении энергии на уровне GPU, стойки и группы стоек.
- Анализ избытка: DPS идентифицирует стойки или GPU, которые работают ниже своего выделенного лимита.
- Перераспределение: Свободная мощность (headroom) автоматически передается тем узлам, которым она нужна прямо сейчас, в рамках заданных политик.
- Валидация: Система проверяет, чтобы общее потребление группы не превышало утвержденный бюджет, и реагирует на аварийные события (например, отключение питания в одном из секторов).
Важно понимать, что DPS не увеличивает общую мощность дата-центра. Он извлекает больше производительности из уже доступных ресурсов. Если бюджет сайта составляет 540 кВт, DPS позволяет использовать этот лимит более плотно, устраняя простои мощности, которые неизбежны при статическом подходе.

Интеграция DPS становится еще более мощной в связке с NVIDIA DSX Exchange — открытой шиной событий для операций ИИ-фабрики. DSX Exchange соединяет DPS с системами управления зданием (BMS), мониторинга электропитания, инфраструктурой охлаждения и планировщиками задач. Это позволяет DPS учитывать внешние факторы. Например, если система охлаждения сообщает о доступном запасе холода из-за прохладной погоды, DPS может временно увеличить мощность вычислительных узлов, зная, что инфраструктура справится с тепловыделением.
03Технологии повышения эффективности «на ватт»
Помимо перераспределения энергии между стойками, MaxLPS включает в себя программные оптимизации на уровне отдельных GPU. NVIDIA разработала оптимизированные профили питания рабочих нагрузок (Workload Profile Power Solutions — WPPS). Вместо того чтобы настраивать частоту, напряжение и поведение памяти для каждого отдельного задания вручную, операторы применяют готовые, проверенные профили, которые идеально соответствуют типу задачи: инференс, обучение, задачи, ограниченные памятью, или задачи, ограниченные вычислительной мощностью.
Менеджер производительности и питания приложений (APPM) применяет эти конфигурации к участвующим GPU. Для сервисов инференса это критически важно, так как цель — максимизировать количество токенов в секунду на ватт. Программное обеспечение, такое как NVIDIA Dynamo, дополнительно оптимизирует межстойковое взаимодействие, обеспечивая согласованную работу всего флота.
Результаты тестирования на системах NVIDIA Vera Rubin NVL72 и GB200 NVL72 демонстрируют впечатляющие цифры. При использовании MaxLPS:
- Выделенная мощность на стойку для GB200 NVL72 снижается с 125 кВт до 90 кВт.
- Для Vera Rubin NVL72 мощность снижается с 136 кВт до 101 кВт.
Это позволяет разместить на 39% и 35% больше стоек соответственно в рамках того же энергетического контура, сохраняя при этом полную пропускную способность рабочих нагрузок. Эффективность на ватт (performance per watt) улучшается примерно в 1.5 раза для GB200 NVL72 и в 1.3–1.4 раза для Vera Rubin NVL72.

04Проектирование ИИ-фабрики: sizing с учетом MaxLPS
Проектирование ИИ-фабрики с использованием MaxLPS начинается с фиксированного общего контура мощности здания и движется внутрь, определяя максимальное количество позиций для стоек GPU. Этот подход устанавливает долгосрочную цель инфраструктуры по мощности, охлаждению, пространству и сетевым возможностям.
Важно понимать концепцию «Day 1» (первоначального развертывания). Начальная загрузка может быть ниже максимального предела инфраструктуры. Например, если сайт изначально ориентирован на обучение моделей (training), которое требует высокой пиковой мощности, среднее потребление на стойку будет выше, чем целевой показатель MaxLPS. Следовательно, изначально можно разместить меньше стоек. Однако по мере того как рабочий процесс эволюционирует и смещается в сторону инференса (inference), среднее потребление на стойку снижается, приближаясь к целевому показателю MaxLPS. Это создает «запас» мощности, позволяющий добавить новые стойки без расширения энергетического контура здания.
Процесс sizing (определения вместимости) включает:
- Выбор семейства GPU.
- Установку целевого показателя PUE (Power Usage Effectiveness) при температуре входа жидкости 45°C.
- Проектирование сети east-west (межстойковой) для максимального количества GPU.
- Расчет общего количества позиций для стоек.
- Принятие решения о первоначальном развертывании (Day 1 deployment).
Такой подход позволяет операторам добавлять GPU и стойки инкрементально по мере изменения рабочих нагрузок, не прибегая к дорогостоящей модернизации инфраструктуры позже.

05Роль охлаждения: почему 45°C — это новая норма
Программное управление питанием — лишь часть уравнения. Вторая критически важная часть — это тепловое проектирование. MaxLPS опирается на использование жидкости с температурой входа 45°C. На первый взгляд, использование более теплой жидкости может показаться нелогичным, но цель заключается в эффективном отводе тепла при сохранении производительности и надежности.
Более высокая температура охлаждающей жидкости позволяет дата-центрам чаще использовать так называемое «бесплатное охлаждение» (free cooling). Это метод, при котором для отвода тепла используется наружный воздух или вода с минимальным использованием механических холодильных машин (chillers). В зависимости от климата и конструкции сайта, это снижает зависимость от энергозатратных чиллеров или водоемких адиабатических (испарительных) охладителей.
Чиллеры остаются важными для пиковых нагрузок и надежности, но их использование только по необходимости снижает общее потребление энергии на охлаждение и улучшает средний годовой показатель PUE. Восстановление этой сэкономленной энергии для вычислений — это задача проектирования объектов, а не только эксплуатации. Системы отвода тепла часто проектируются с запасом на худшие сценарии, но в большинстве случаев требуется гораздо меньше мощности компрессоров. Если распределение электроэнергии, сухие охладители и системы управления спроектированы с учетом этой гибкости, мощность, зарезервированная на охлаждение в самый жаркий час года, становится доступной для вычислений большую часть года.

06Управление технологическим контуром охлаждения (TCS)
Технологический контур охлаждения (Technology Cooling System — TCS) — это жидкостный контур, который перемещает тепло от стоек, через холодные пластины GPU, к блоку распределения охлаждающей жидкости (CDU). Он работает в связке с общим контуром охлаждения объекта, который отводит тепло через чиллеры, сухие охладители или градирни.
Многие объекты используют пропорционально-интегрально-дифференциальные (PID) контроллеры для управления поведением CDU. PID-контроллеры полезны, но они реактивны: они реагируют только после того, как датчики сообщают об отклонении. В больших ИИ-фабриках тепловая нагрузка меняется быстро и синхронно, поэтому операторы часто держат контур холоднее необходимого, чтобы создать буфер безопасности. Этот консервативный буфер тратит энергию охлаждения, которую можно было бы направить на вычисления.
Альтернативой являются агентные системы управления (agentic control systems), такие как решения от Phaidra. Они используют телеметрию питания и изученные политики управления для прогнозирования теплового поведения. Хотя стойка с эффективностью 45°C не требует агентного управления для базовой работы, такие системы выступают оптимизацией поверх аппаратного обеспечения, позволяя еще точнее балансировать между температурой и энергопотреблением.
07Что это значит на практике
Для операторов дата-центров и облачных провайдеров внедрение NVIDIA DSX MaxLPS означает переход от реактивного управления ресурсами к проактивному, интеллектуальному планированию. Это не просто обновление ПО, а пересмотр всей архитектуры эксплуатации ИИ-фабрик.
Во-первых, это прямое влияние на экономику. Возможность разместить до 40% больше GPU в том же физическом пространстве и с той же мощностью питания означает значительное снижение стоимости владения (TCO) на каждый токен. Во-вторых, это гибкость. Инфраструктура, спроектированная с учетом MaxLPS, готова к эволюции рабочих нагрузок. Она позволяет начать с обучения моделей, а затем плавно перейти к инференсу, добавляя мощности по мере необходимости, без капитального ремонта здания.
В-третьих, это экологический аспект. Повышение эффективности использования энергии (PUE) и снижение зависимости от чиллеров за счет использования 45°C жидкости напрямую сокращают углеродный след ИИ-индустрии. В мире, где устойчивость становится ключевым требованием к инфраструктуре, MaxLPS предлагает путь к более «зеленому» ИИ без потери производительности.
Внедрение MaxLPS требует раннего вовлечения на этапе проектирования сайта, интеграции систем управления зданием и использования программного обеспечения NVIDIA DSX. Однако результаты — в виде значительно более высокой плотности вычислений, улучшенной эффективности на ватт и возможности масштабирования без расширения энергетического контура — делают эти усилия абсолютно оправданными для тех, кто строит ИИ-фабрики будущего.
Источник: NVIDIA Developer ↗
