Ricerca
Che cosa permette ai modelli del mondo e dell’azione di generalizzare? Uno studio empirico sulla modellazione del futuro in fase di test
Durante l’addestramento, i modelli del mondo e dell’azione (WAM) predicono il futuro insieme alle azioni. Poiché rimuovere il rumore dai video richiede molte risorse di calcolo, è oggetto di dibattito
- arXiv
- 2609.34981
- Pubblicato
- 2026-09-28
- Autori
- Renping Zhou, Zanlin Ni, Zihao Fan, Guohao Fu, Zeyu Liu, Hao Shi, Jie Zhang, Chi Bene Chen, Yang Yue, Xueyang Fu, Gao Huang
Abstract degli autori
Durante l’addestramento, i modelli del mondo e dell’azione (WAM) predicono il futuro insieme alle azioni. Poiché rimuovere il rumore dai video richiede molte risorse di calcolo, è oggetto di dibattito se sia ancora necessario generare il futuro durante l’inferenza: i WAM espliciti ne rimuovono il rumore fino a ottenere fotogrammi privi di rumore insieme a ogni blocco di azioni, mentre i WAM latenti lo eliminano del tutto per accelerare il processo. Riscontriamo che i WAM latenti, pur eguagliando quelli espliciti nei compiti simili ai dati di addestramento, non conservano i vantaggi di generalizzazione che avevano originariamente motivato lo sviluppo dei WAM. Per dimostrarlo, valutiamo la generalizzazione lungo tre dimensioni: perturbazioni dell’ambiente, efficienza nell’uso dei dati e generalizzazione a nuovi compiti. Confronti controllati, a parità di architettura di base, dati di addestramento e risorse disponibili, mostrano un peggioramento costante in tutte e tre le dimensioni quando l’esperto delle azioni non si basa più sulle rappresentazioni del futuro. Ulteriori analisi mostrano che la differenza deriva quasi interamente dal primo passaggio di rimozione del rumore: il vantaggio sta nel preparare il futuro, non nel generarlo. Proponiamo quindi Simple-WAM, che riduce la modellazione del futuro a un unico passaggio in avanti su token video completamente alterati dal rumore e adatta a questo comportamento in fase di inferenza la sequenza dei livelli di rumore usata durante l’addestramento. Nei compiti simulati e in quelli reali, Simple-WAM combina i vantaggi dei due approcci: supera i WAM espliciti nelle prestazioni di generalizzazione, con un’efficienza paragonabile a quella dei WAM latenti. Pagina del progetto: https://zrporz.github.io/Simple-WAM-Web/