Vai al contenuto
AI.info

Ricerca

MemBodied: memoria associativa ricorrente per modelli visione-linguaggio-azione

I modelli Vision-Language-Action offrono solide basi per il controllo di robot per uso generale, ma la stragrande maggioranza delle policy non conserva né sfrutta informazioni a livello di episodio ol

MemBodied: memoria associativa ricorrente per modelli visione-linguaggio-azione
arXiv
2609.28256
Pubblicato
2026-09-23
Autori
Tej Deep Pala, Navonil Majumder, Bryce Goh, Raphael Yee, Jianfei Yang, Liming Chen, Soujanya Poria

Abstract degli autori

I modelli Vision-Language-Action offrono solide basi per il controllo di robot per uso generale, ma la stragrande maggioranza delle policy non conserva né sfrutta informazioni a livello di episodio oltre l’osservazione corrente. Questo limite è rilevante nei compiti di manipolazione dipendenti dalla storia, che si basano su informazioni disponibili solo nelle osservazioni passate. Mantenere in contesto le osservazioni precedenti può aiutare a recuperare queste informazioni, ma al prezzo significativo di un contesto sempre più ampio e ingombrante e di una maggiore latenza di inferenza. Presentiamo quindi MemBodied, una memoria episodica a dimensione fissa composta da due componenti complementari: uno stato associativo, che registra le interazioni tra una chiamata della policy e l’altra, e un’ancora dell’episodio, che conserva una rappresentazione compatta della scena iniziale come riferimento. A ogni chiamata della policy, il modello condiziona la generazione delle azioni sull’input corrente e sulle componenti della memoria, anziché utilizzare direttamente le osservazioni passate. Nei cinque task di RMBench valutati che richiedono memoria, MemBodied raggiunge un tasso medio di successo pari a $7.81\times$ quello di una policy senza memoria e a $2.98\times$ quello di una memoria ricorrente standard, superando del $1.3\times$ il baseline con memoria più performante, con $10\times$ meno parametri aggiuntivi. Nella suite LIBERO-Long, completamente osservabile, ha raggiunto il 90,6%, con un miglioramento del 5,4% rispetto alla policy $π_0$ senza memoria. Questi risultati indicano che MemBodied è un’alternativa pratica all’ampliamento del contesto della policy nei compiti di manipolazione dipendenti dalla storia.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv