Проблема координации в MARL
Многосуточная обучение с подкреплением (MARL) обещает революцию в автономных системах, но тактическая координация остается сложной задачей. Основные барьеры — отсутствие структурированного моделирования отношений между объектами и «плоские» архитектуры, которые не могут явно назначать тактические роли (например, лидер/поддержка) в динамичной среде.
Архитектура DRG-MAPPO
Новая система DRG-MAPPO (Hierarchical Dynamic Role-Graph Multi-Agent Proximal Policy Optimization) решает эти проблемы через двухуровневую иерархию:
- Высокоуровневая политика: использует механизм графового внимания (Graph Attention) для извлечения реляционных признаков между союзниками, врагами и угрозами. На основе этого она динамически назначает тактические роли.
- Низкоуровневая политика: выполняет дискретные маневры, опираясь на назначенные роли и закодированные графовые признаки.
Дополнительно внедрена вспомогательная задача приоритизации целей, что стимулирует появление поведения «концентрации огня» (focus-fire).
Результаты и метрики
Эксперименты показали, что предложенный фреймворк эффективно балансирует реляционное моделирование, интерпретируемость и стабильность оптимизации. Ключевая метрика — доля побед — достигла 87%, что является state-of-the-art результатом для данной задачи.
| Параметр | Значение / Описание |
|---|---|
| Название модели | DRG-MAPPO |
| Доля побед (Win Rate) | 87% |
| Тип архитектуры | Иерархическая MARL с графами ролей |
| Ключевые агенты | Лидер, Поддержка (динамически назначаемые) |
| Дата публикации | 10 сентября 2026 |
Значение для индустрии
Работа демонстрирует переход от простых агентов к сложным тактическим группам. Внедрение графовых моделей отношений позволяет ИИ-системам понимать контекст боя, а не просто реагировать на стимулы, что критически важно для создания надежных автономных боевых систем.
Источник: arXiv cs.AI ↗
