Исследования12 сентября 2026 г., 14:20 МСК🤖 Auto

DRG-MAPPO: 87% побед в кооперативных воздушных боях через графы ролей

Исследователи представили DRG-MAPPO — иерархическую MARL-систему, использующую динамические графы ролей для тактического взаимодействия в воздушных боях.

Баннер новости 7357

Проблема координации в MARL

Многосуточная обучение с подкреплением (MARL) обещает революцию в автономных системах, но тактическая координация остается сложной задачей. Основные барьеры — отсутствие структурированного моделирования отношений между объектами и «плоские» архитектуры, которые не могут явно назначать тактические роли (например, лидер/поддержка) в динамичной среде.

Архитектура DRG-MAPPO

Новая система DRG-MAPPO (Hierarchical Dynamic Role-Graph Multi-Agent Proximal Policy Optimization) решает эти проблемы через двухуровневую иерархию:

  • Высокоуровневая политика: использует механизм графового внимания (Graph Attention) для извлечения реляционных признаков между союзниками, врагами и угрозами. На основе этого она динамически назначает тактические роли.

  • Низкоуровневая политика: выполняет дискретные маневры, опираясь на назначенные роли и закодированные графовые признаки.

Дополнительно внедрена вспомогательная задача приоритизации целей, что стимулирует появление поведения «концентрации огня» (focus-fire).

Результаты и метрики

Эксперименты показали, что предложенный фреймворк эффективно балансирует реляционное моделирование, интерпретируемость и стабильность оптимизации. Ключевая метрика — доля побед — достигла 87%, что является state-of-the-art результатом для данной задачи.

Параметр Значение / Описание
Название модели DRG-MAPPO
Доля побед (Win Rate) 87%
Тип архитектуры Иерархическая MARL с графами ролей
Ключевые агенты Лидер, Поддержка (динамически назначаемые)
Дата публикации 10 сентября 2026

Значение для индустрии

Работа демонстрирует переход от простых агентов к сложным тактическим группам. Внедрение графовых моделей отношений позволяет ИИ-системам понимать контекст боя, а не просто реагировать на стимулы, что критически важно для создания надежных автономных боевых систем.

Источник: arXiv cs.AI ↗