Ricerca
LOCI: memoria lineare spaziale per modelli del mondo in streaming
Quando una telecamera torna a inquadrare una regione già osservata, un modello del mondo per i video dovrebbe riprodurre ciò che vi si trovava prima. Per farlo deve sia ricordare le osservazioni passa

- arXiv
- 2609.40222
- Pubblicato
- 2026-09-30
- Autori
- Ji Xia, Tingting Liao, Xuezhi Liang, Hao Li, Guangyi Liu
Abstract degli autori
Quando una telecamera torna a inquadrare una regione già osservata, un modello del mondo per i video dovrebbe riprodurre ciò che vi si trovava prima. Per farlo deve sia ricordare le osservazioni passate sia recuperare quella giusta per il punto di vista attuale. Le cache chiave-valore conservano i dettagli visivi, ma crescono con la durata del video; la memoria ricorrente è compatta, ma comprime la storia in uno stato di dimensioni fisse, rendendo le singole osservazioni passate non più direttamente accessibili. Presentiamo LOCI, un’architettura ibrida di memoria spaziale che mantiene entrambe le rappresentazioni. In metà dei blocchi transformer, l’attenzione principale usa una cache chiave-valore delle osservazioni passate; nell’altra metà è limitata alla porzione corrente ed è affiancata da una memoria ricorrente con attenzione lineare, le cui operazioni di lettura e scrittura dipendono dalla geometria proiettiva della telecamera. Il punto di vista determina così sia come si accede alla memoria sia ciò che vi viene conservato. Le informazioni lette dalla memoria ricorrente passano ai blocchi successivi dotati di cache e forniscono alle loro query il contesto della scena accumulato. Sul benchmark pubblico di memoria MIND e su traiettorie registrate tenute da parte, LOCI riproduce i contenuti già osservati con maggiore fedeltà rispetto a modelli del mondo rappresentativi e a un modello con softmax completa che segue la stessa procedura; usando l’intera storia, riduce il picco di memoria di circa il 30% rispetto alla softmax completa a parità di lunghezza. Con un insieme limitato di osservazioni conservate, elabora in streaming video lunghi usando una quantità costante di memoria e mantiene una fedeltà maggiore rispetto alla softmax completa a parità di budget.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv