Ricerca
DRG-MAPPO: apprendimento per rinforzo multiagente gerarchico con grafo dinamico dei ruoli per il combattimento aereo cooperativo
L’apprendimento per rinforzo multiagente (MARL) si è affermato come paradigma fondamentale per i processi decisionali complessi nei sistemi autonomi e nel combattimento aereo. Sebbene il MARL abbia mo

- arXiv
- 2609.11155
- Pubblicato
- 2026-09-10
- Autori
- Junlin Liu, Chengwei Li, Yang Gao, Hui Chang, Xinchen Zhang, Zhijun Zhao, Hao Zhao
Abstract degli autori
L’apprendimento per rinforzo multiagente (MARL) si è affermato come paradigma fondamentale per i processi decisionali complessi nei sistemi autonomi e nel combattimento aereo. Sebbene il MARL abbia mostrato un notevole potenziale nel combattimento aereo, raggiungere un coordinamento tattico sofisticato resta una sfida tutt’altro che banale. La difficoltà è dovuta in larga misura a due limiti principali: (1) l’assenza di una modellazione strutturata delle relazioni impedisce agli agenti di cogliere le interazioni complesse e mutevoli nel tempo tra le entità presenti sul campo di battaglia; e (2) le architetture piatte convenzionali spesso non sono in grado di modellare esplicitamente i ruoli tattici, con il risultato di un’assegnazione ambigua dei compiti in ambienti altamente dinamici. Per affrontare queste sfide, proponiamo Hierarchical Dynamic Role-Graph Multi-Agent Proximal Policy Optimization (DRG-MAPPO), un nuovo framework MARL che integra la modellazione delle relazioni basata su grafi con l’assegnazione dinamica dei ruoli. Nello specifico, DRG-MAPPO costruisce una rappresentazione basata su grafi delle interazioni sul campo di battaglia e sfrutta meccanismi di attenzione sui grafi per estrarre le caratteristiche relazionali più importanti tra alleati, nemici e minacce. Successivamente, una politica di alto livello impiega un meccanismo di assegnazione dinamica dei ruoli per stabilire le responsabilità tattiche (per esempio, «leader» e «supporto»). Sulla base di questi ruoli e delle caratteristiche relazionali codificate nel grafo, una politica di basso livello esegue manovre discrete, consentendo l’ottimizzazione congiunta della strategia tattica e dell’esecuzione collaborativa. Inoltre, è previsto un compito ausiliario di definizione delle priorità dei bersagli per favorire l’emergere di comportamenti come il fuoco concentrato. I risultati sperimentali mostrano che DRG-MAPPO raggiunge un tasso di vittorie dell’87%, ai vertici dello stato dell’arte, suggerendo che il nostro framework bilancia efficacemente modellazione delle relazioni, interpretabilità e stabilità dell’ottimizzazione nel combattimento aereo cooperativo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv