Ricerca
UniWAM: modello unificato del mondo e dell’azione
I modelli visione-linguaggio-azione beneficiano delle capacità di comprensione e ragionamento dei modelli visione-linguaggio preaddestrati, ma la supervisione basata soltanto sulle azioni offre un anc

- arXiv
- 2610.02054
- Pubblicato
- 2026-10-01
- Autori
- Jiayi Chen, Wenxuan Song, Jingbo Wang, Shuai Zhou, Xicheng Gong, Zehua Fan, Ziyang Zhou, Junwu E, Haodong Yan, Fuhao Li, Qize Yu, Xu Huang, Pengwei Wang, Wen Chen, Shunbo Zhou, Haoang Li
Abstract degli autori
I modelli visione-linguaggio-azione beneficiano delle capacità di comprensione e ragionamento dei modelli visione-linguaggio preaddestrati, ma la supervisione basata soltanto sulle azioni offre un ancoraggio limitato alle dinamiche del mondo. Viceversa, i modelli del mondo e dell’azione ereditano dai modelli di generazione video conoscenze a priori spazio-temporali, ma restano limitati nella comprensione semantica e nel ragionamento quando la distribuzione dei dati cambia. Presentiamo UniWAM, un’architettura unificata che integra un modulo di ragionamento fisico, un generatore del mondo e un predittore di azioni per apprendere congiuntamente la comprensione semantica del mondo fisico, la generazione visiva e la previsione delle azioni. Per garantire la qualità dei dati di addestramento, abbiamo sviluppato una rigorosa procedura di pulizia e annotazione sia per i dati egocentrici umani sia per i dati robotici. Per adattare la componente visione-linguaggio ai compiti che richiedono un’interazione fisica con l’ambiente, preservandone le capacità linguistiche ereditate, rappresentiamo le azioni di basso livello in linguaggio naturale e introduciamo una procedura di preaddestramento che assegna alle componenti appropriate del modello forme di supervisione complementari, ricavate da dati di risposta a domande visive (VQA), dati egocentrici umani e dimostrazioni robotiche. Durante la fase successiva all’addestramento, l’aumento dei dati mediante rumore visivo futuro riduce la dipendenza da previsioni future precise, mentre il flow matching condizionato dalla cronologia usa la cronologia codificata delle azioni per inizializzare la generazione delle azioni. Nel complesso, queste scelte riducono significativamente i passaggi di denoising senza compromettere le prestazioni. UniWAM raggiunge prestazioni allo stato dell’arte (SOTA) in diverse valutazioni, tra cui le prestazioni all’interno della distribuzione dei dati, la robustezza, la generalizzazione, la capacità di seguire le istruzioni e l’esecuzione di compiti su un lungo orizzonte. Inoltre, individuiamo una legge di scala log-lineare per l’addestramento congiunto unificato su dati umani e robotici, dimostrando l’efficacia del preaddestramento su larga scala con una combinazione di dati umani e robotici.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv