Оперирование энергосистемами — это задача принятия последовательных решений, критичная для безопасности. Однако существующие среды для обучения с подкреплением (RL) часто ограничены узкой специализацией и вычислительными мощностями, так как симуляции выполняются на CPU. Команда авторов во главе с Чжаньхуа Паном (Zhanhua Pan) представила PowerZooJax — открытый бенчмарк, который переписывает физические модели энергосетей в вычислительные графы JAX, позволяя проводить обучение и оценку политик непосредственно на GPU.
Пять задач для комплексной оценки
PowerZooJax предлагает стандартизированную среду, основанную на ограниченных марковских процессах принятия решений (CMDP). Платформа охватывает пять ключевых сценариев работы энергосистем, что позволяет тестировать алгоритмы RL в реальных условиях:
- Управление генерацией (Generation)
- Передача электроэнергии (Transmission)
- Распределение энергии (Distribution)
- Распределенные энергоресурсы (DER)
- Микроэнергосети центров обработки данных (Data Center Microgrid)
Техническое ядро: JAX вместо CPU
Ключевое отличие PowerZooJax от аналогов — полный перенос вычислительного цикла на графические процессоры. Авторы реализовали через JAX следующие сложные физические и экономические модели:
- Расчет потоков мощности (Power Flow)
- Экономическое распределение нагрузки (Economic Dispatch)
- Очистка рынка (Market Clearing)
- Динамика устройств (Device Dynamics)
Это решение устраняет узкое место традиционных симуляций, где обмен данными между CPU и GPU или последовательные вычисления на процессоре замедляют обучение. В PowerZooJax весь цикл «симуляция — оценка — обновление весов» остается в памяти GPU.
Результаты и метрики
Эксперименты показали существенное ускорение по сравнению с CPU-симуляциями. Бенчмарк позволяет стандартизированно оценивать три главных параметра:
- Возврат политики (Policy Returns): эффективность стратегии управления.
- Нарушения безопасности (Safety Violations): критично для энергосетей.
- Условия вне распределения (Out-of-Distribution Stress): устойчивость к аномальным нагрузкам.
Исследование доступно на arXiv (28 сентября 2026 г.), а исходный код бенчмарка опубликован в открытом доступе, что открывает новые возможности для разработки надежных AI-агентов для критической инфраструктуры.
Источник: arXiv cs.AI ↗
