Исследования13 августа 2026 г., 10:18 МСК🤖 Auto

RL-контроллер снизил энергопотребление LLM на 26% и увеличил вывод токенов

Исследователь Eliseo Curcio представил PPO-мета-контроллер, который в реальном времени регулирует параметры генерации LLM для оптимизации энергопотребления GPU, избегая перегрузок дата-центров.

Баннер новости 5687

Проблема: Слепое управление питанием GPU

Современные центры обработки данных для ИИ (AI datacenters) управляют энергопотреблением графических процессоров с помощью статических лимитов и реактивного троттлинга. Эти механизмы не учитывают специфику рабочих нагрузок, что приводит к indiscriminate slowdown (бессистемному замедлению) оборудования и неэффективному использованию энергии. Особенно это критично в фазе post-training языковых моделей, где доминирует обучение с подкреплением (Reinforcement Learning, RL), например, алгоритм GRPO (Group Relative Policy Optimization).

Решение: PPO-мета-контроллер с телеметрией

Автор исследовал поведение мощности при обучении GRPO на моделях масштаба 7B, 14B и 72B. Была собрана база из более чем 380 000 образцов с полусекундной телеметрией питания на конфигурациях от 1 до 4 GPU NVIDIA A100. На основе этих данных обучен PPO-мета-контроллер, который адаптирует параметры генерации самой рабочей нагрузки в ответ на измеренное потребление энергии.

Результаты на масштабе 7B

На полном 500-шаговом трейсе модели 7B контроллер показал выдающиеся результаты, оптимизируя баланс между производительностью и энергоэффективностью:

Метрика Изменение Значение
Нарушения лимита мощности Снижение 89.8%
Вывод токенов (Throughput) Рост +18.1%
Энергоэффективность Рост +26.2% (токенов на MWh)

Вызов масштабирования до 72B и 16 GPU

Первоначальное развертывание на модели 72B дало нулевые результаты из-за потери авторитета актуатора при шардировании модели. Однако анализ выявил принцип «occupancy-versus-volume»: параметры, применяемые как параллелизм генерации, сохраняют 17-22% власти над питанием. Пересобранная версия контроллера успешно управляла рабочей нагрузкой 72B на трех репликациях:

  • +35.7% вывода по сравнению со статическим безопасным базисом.
  • 2.27 ± 1.08% нарушений бюджета питания (против 87.2% нарушений в неконтролируемом режиме).
  • Лучшая средняя пропускная способность и энергоэффективность на токен среди всех контролируемых контроллеров.

Экономический потенциал и выводы

Исследование показало, что при измерительных окнах 30 секунд и более пиковое потребление для составного флота из 16 GPU падает до 50-56% от номинальной мощности (nameplate). Это позволяет теоретически увеличить oversubscription (сверхподписку) номинальной мощности примерно в два раза, что может существенно снизить капитальные затраты (CapEx) на строительство новых дата-центров для ИИ.

Источник: arXiv cs.AI ↗