Энергия как главный лимит AI-фабрик
Электроэнергия составляет до 40% операционных расходов (OpEx) при запуске AI-фабрик. Поскольку мощности часто ограничены региональными поставщиками, ключевым показателем эффективности становится производительность на ватт (performance per watt). NVIDIA утверждает, что достигла самой низкой стоимости токена для инференса и обучения благодаря экстремальному системному ко-дизайну, охватывающему питание, охлаждение и инфраструктуру.
Аппаратный уровень: GB200 NVL72 и NVFP4
За шесть поколений архитектур NVIDIA увеличила пропускную способность инференса на мегаватт в 1 000 000 раз. Флагманская система GB200 NVL72 использует плотное чип-ориентированное жидкостное охлаждение и сглаживание пиковых нагрузок внутри стойки, что позволяет безопасно размещать больше GPU в рамках фиксированного бюджета питания. Программно-аппаратная оптимизация через NVIDIA DSX и Dynamo динамически распределяет мощность, а использование узких форматов точности, таких как NVFP4, обеспечивает ту же точность, что и FP8, но с меньшим энергопотреблением.
Оптимизация обучения: экономия 25% энергии
В области обучения больших языковых моделей (LLM) NVIDIA совместно с инициативой ML.ENERGY (Университет Мичигана) внедрила технику согласованной настройки скорости GPU. Вместо того чтобы все ускорители работали на максимуме, создавая простои, система намеренно замедляет GPU, не находящиеся на критическом пути. Это минимизирует время простоя и снижает общее энергопотребление.
| Технология / Метрика | Описание и эффект |
|---|---|
| Согласованная настройка скорости GPU | Замедление не-критических узлов для снижения энергозатрат без увеличения времени обучения |
| Экономия энергии | До 25% снижения потребления при сохранении скорости итераций |
| Megatron-LM | Оптимизация профилирования на уровне ядра и планирования для выявления узких мест |
| MoE-модели (например, DeepSeek-R1) | Более энергоэффективны плотных аналогов: активны только подмножества экспертов на токен |
Почему это важно для индустрии
Результаты позволяют операторам перенаправлять сэкономленную мощность с обучения на инференс, увеличивая количество генерируемых токенов без расширения энергетического контура дата-центра. Для бизнеса это прямой рост выручки на единицу времени и снижение себестоимости AI-сервисов. Внедрение таких практик становится критическим фактором при масштабировании AI-инфраструктуры в масштабах от десятков до гигаватт.
Источник: NVIDIA dev blog ↗
