Ricerca
La memoria come piani: modellazione del mondo e delle azioni con una pianificazione basata sulla memoria
Le politiche robotiche più diffuse adottano spesso una formulazione markoviana, ma molti compiti complessi di manipolazione nel mondo reale sono intrinsecamente non markoviani e richiedono una memoria

- arXiv
- 2609.11561
- Pubblicato
- 2026-09-10
- Autori
- Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang, Chenyang Wang, Qinglin Liu, Shengping Zhang
Abstract degli autori
Le politiche robotiche più diffuse adottano spesso una formulazione markoviana, ma molti compiti complessi di manipolazione nel mondo reale sono intrinsecamente non markoviani e richiedono una memoria che copra orizzonti temporali lunghi, oltre l’osservazione corrente. I meccanismi di memoria esistenti si basano spesso su riepiloghi testuali, finestre visive via via più ampie o una combinazione dei due; possono quindi perdere informazioni visive dettagliate o imporre un compromesso tra la copertura della cronologia e l’efficienza dell’esecuzione. Presentiamo MaP-WAM, un framework che tratta la memoria come piani: scompone la modellazione del mondo e delle azioni dipendente dalla memoria in pianificazione basata sulla memoria ed esecuzione condizionata dal piano. Usa inoltre un contesto episodico multimodale a lungo termine come fonte di informazioni durante la pianificazione, anziché condizionare ripetutamente l’esecutore sull’intera cronologia. MaP-WAM rappresenta la memoria mediante registrazioni dei segmenti completati, contenenti istruzioni testuali e un contesto visivo sparso, e trasforma questa memoria episodica in piani compatti che comprendono un piano testuale per il segmento successivo e le corrispondenti indicazioni visive. Un modello World-Action-Progress (WAP) esegue ciascun piano per una durata sconosciuta, prevedendo congiuntamente, in fase di inferenza, sequenze di azioni e il corrispondente avanzamento dell’esecuzione. Calibra l’avanzamento previsto mediante l’allineamento tra piano e osservazione, per consentire transizioni adattive tra segmenti e aggiornamenti del contesto a ciclo chiuso. MaP-WAM mantiene fissa la lunghezza del contesto dell’esecutore, mentre l’attenzione strutturata consente inoltre di memorizzare nella cache le coppie chiave-valore sia nella pianificazione sia nell’esecuzione. MaP-WAM ottiene prestazioni allo stato dell’arte su RMBench, con un tasso di successo dell’83,3%, e raggiunge un tasso di successo del 78,0% nei compiti svolti da robot reali, mantenendo pressoché costante la latenza dell’inferenza dell’esecutore al crescere della cronologia del compito.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv