Ricerca
SimpleMemVLA: una memoria video nativa semplice ma efficace per i modelli visione-linguaggio-azione
La manipolazione su orizzonti temporali lunghi è parzialmente osservabile: le informazioni necessarie per scegliere l’azione successiva possono comparire soltanto in osservazioni risalenti a diversi m

- arXiv
- 2609.05533
- Pubblicato
- 2026-09-02
- Autori
- Cheng Yin, Wang Xu, Junpeng Yang, Sikyuen Tam, Hanyu Liu, Yuan Yao, Xiangrui Zeng, Junbo Cui, Yequan Wang, Zhouping Yin, Yankai Lin
Abstract degli autori
La manipolazione su orizzonti temporali lunghi è parzialmente osservabile: le informazioni necessarie per scegliere l’azione successiva possono comparire soltanto in osservazioni risalenti a diversi minuti prima. I meccanismi di memoria esistenti — banche di recupero delle informazioni, compressori addestrati e stati ricorrenti — devono decidere che cosa conservare del passato prima di sapere che cosa richiederà una decisione futura. Questa scelta era motivata dall’ipotesi che una cronologia di diversi minuti fosse troppo ampia da elaborare direttamente, un’ipotesi che i moderni modelli VLM di base hanno reso superata. In questo lavoro presentiamo SimpleMemVLA, un modello VLA privo di un modulo di memoria dedicato. Mantiene intatta la cronologia campionata e la passa al modello di base nel formato video con timestamp per la cui elaborazione il modello è stato preaddestrato; gli stati nascosti di un sottocompito generato costituiscono quindi l’unico canale attraverso cui la cronologia raggiunge una testa standard per le azioni basata sul flow matching. Poiché le decisioni consecutive condividono gran parte della cronologia, eseguire il prefill del prefisso condiviso durante l’esecuzione dell’azione mantiene la latenza vicina a quella di un VLA a fotogramma singolo. SimpleMemVLA stabilisce un nuovo stato dell’arte su quattro benchmark di memoria senza penalizzare il controllo generale. A parità di modello di base e configurazione di addestramento, supera ampiamente i meccanismi basati su recupero delle informazioni, compressione e stati ricorrenti; interventi causali confermano inoltre che la policy legge effettivamente la propria cronologia. Codice disponibile all’indirizzo https://github.com/wadeKeith/SimpleMemVLA
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv