Проблема гетерогенности в IoT
С развитием Интернета вещей (IoT) вычислительно сложные задачи, представленные в виде направленных ациклических графов (DAG), становятся нормой в средах «облако-периферия-устройство» (cloud-edge-end). Ключевая проблема заключается в высокой гетерогенности узлов: они различаются по вычислительной мощности, пропускной способности сети и энергопотреблению. Это делает эффективное планирование задач с сложными зависимостями NP-трудной задачей, где традиционные эвристические алгоритмы и стандартные методы обучения с подкреплением часто не способны уловить пространственно-временную динамику ресурсов.
Архитектура PPO-STGNN
Авторы предлагают решение PPO-STGNN, которое интегрирует алгоритм Proximal Policy Optimization (PPO) со пространственно-временными графовыми нейронными сетями (STGNN). Методология включает два ключевых этапа:
- Извлечение признаков: STGNN анализирует топологию DAG-задач и физический граф ресурсов (облако, периферия, устройства), захватывая их пространственные и временные зависимости.
- Оптимизация политики: PPO использует эти признаки для формирования политики расписания, направленной на минимизацию времени выполнения (makespan) и отношения длины расписания (SLR), а также на улучшение балансировки нагрузки CPU и памяти.
Ускорение сходимости через мульти-учителя
Для решения проблемы долгой сходимости типичных RL-алгоритмов в PPO-STGNN внедрен механизм предварительного обучения с поведением мульти-учителя (multi-teacher behavior-cloning). Это позволяет модели быстрее освоить базовые стратегии планирования перед переходом к тонкой настройке через PPO.
Результаты и значимость
Эксперименты показывают, что PPO-STGNN значительно превосходит базовые методы по показателям балансировки нагрузки, сохраняя при этом низкое время завершения задач. Это делает алгоритм перспективным для динамичных и гетерогенных сценариев распределенных вычислений, где критичны задержки и эффективность использования ресурсов.
Источник: arXiv cs.AI ↗
