Проблема: Слепое управление питанием GPU
Современные центры обработки данных для ИИ (AI datacenters) управляют энергопотреблением графических процессоров с помощью статических лимитов и реактивного троттлинга. Эти механизмы не учитывают специфику рабочих нагрузок, что приводит к indiscriminate slowdown (бессистемному замедлению) оборудования и неэффективному использованию энергии. Особенно это критично в фазе post-training языковых моделей, где доминирует обучение с подкреплением (Reinforcement Learning, RL), например, алгоритм GRPO (Group Relative Policy Optimization).
Решение: PPO-мета-контроллер с телеметрией
Автор исследовал поведение мощности при обучении GRPO на моделях масштаба 7B, 14B и 72B. Была собрана база из более чем 380 000 образцов с полусекундной телеметрией питания на конфигурациях от 1 до 4 GPU NVIDIA A100. На основе этих данных обучен PPO-мета-контроллер, который адаптирует параметры генерации самой рабочей нагрузки в ответ на измеренное потребление энергии.
Результаты на масштабе 7B
На полном 500-шаговом трейсе модели 7B контроллер показал выдающиеся результаты, оптимизируя баланс между производительностью и энергоэффективностью:
| Метрика | Изменение | Значение |
|---|---|---|
| Нарушения лимита мощности | Снижение | 89.8% |
| Вывод токенов (Throughput) | Рост | +18.1% |
| Энергоэффективность | Рост | +26.2% (токенов на MWh) |
Вызов масштабирования до 72B и 16 GPU
Первоначальное развертывание на модели 72B дало нулевые результаты из-за потери авторитета актуатора при шардировании модели. Однако анализ выявил принцип «occupancy-versus-volume»: параметры, применяемые как параллелизм генерации, сохраняют 17-22% власти над питанием. Пересобранная версия контроллера успешно управляла рабочей нагрузкой 72B на трех репликациях:
- +35.7% вывода по сравнению со статическим безопасным базисом.
- 2.27 ± 1.08% нарушений бюджета питания (против 87.2% нарушений в неконтролируемом режиме).
- Лучшая средняя пропускная способность и энергоэффективность на токен среди всех контролируемых контроллеров.
Экономический потенциал и выводы
Исследование показало, что при измерительных окнах 30 секунд и более пиковое потребление для составного флота из 16 GPU падает до 50-56% от номинальной мощности (nameplate). Это позволяет теоретически увеличить oversubscription (сверхподписку) номинальной мощности примерно в два раза, что может существенно снизить капитальные затраты (CapEx) на строительство новых дата-центров для ИИ.
Источник: arXiv cs.AI ↗
