Ricerca
Spezzare la scorciatoia visione-azione: addestramento dell’interfaccia latente per modelli fondazionali di robotica capaci di generalizzare
I modelli fondazionali per la robotica ottengono prestazioni elevate sui dati appartenenti alla distribuzione di addestramento, ma spesso peggiorano quando cambia la distribuzione visiva. Nell’imparar

- arXiv
- 2609.12641
- Pubblicato
- 2026-09-11
- Autori
- Jianman Lin, Shailesh Shailesh, Zhongyi Luo, Jiafei Duan
Abstract degli autori
I modelli fondazionali per la robotica ottengono prestazioni elevate sui dati appartenenti alla distribuzione di addestramento, ma spesso peggiorano quando cambia la distribuzione visiva. Nell’imparare a generare azioni a partire da rappresentazioni visive preaddestrate, i modelli possono sfruttare indizi visivi irrilevanti per il compito che, nella distribuzione di addestramento, sono correlati alle azioni mostrate nelle dimostrazioni. Queste scorciatoie visione-azione possono compromettere la capacità di generalizzare quando tali correlazioni cambiano. Per contrastarle occorre vincolare l’uso delle informazioni visive nella generazione delle azioni, preservando al contempo le informazioni spaziali rilevanti per il compito. Proponiamo Latent Interface Training (LIT), una strategia in due fasi indipendente dall’architettura: prima stabilisce un modello a priori delle azioni condizionato da un obiettivo spaziale, senza usare immagini; poi vincola il condizionamento visivo attraverso un’interfaccia latente supervisionata tramite la posa. Nella fase 1, l’esperto delle azioni viene addestrato a generare sequenze di azioni condizionate dal linguaggio, dallo stato del robot e dalla posa SE(3) finale dell’effettore di ciascuna sequenza mostrata nelle dimostrazioni, imparando a generare azioni dirette a un obiettivo indipendentemente dagli indizi visivi. La fase 2 introduce un’interfaccia latente che aggrega rappresentazioni visive e semantiche e costituisce l’unica via attraverso cui le informazioni visive condizionano l’esperto delle azioni preaddestrato. L’interfaccia viene supervisionata affinché ricostruisca la posa finale usata in precedenza per condizionare la fase 1, incoraggiandola a conservare le informazioni spaziali rilevanti per l’obiettivo e necessarie alla generazione delle azioni. Su quattro architetture visione-linguaggio-azione e mondo-azione (Pi0.5, MolmoAct2, FAST-WAM e ImageWAM), LIT aumenta il tasso di successo complessivo su LIBERO-Plus di 3,87–10,70 punti percentuali, mantenendo o migliorando il tasso medio di successo su LIBERO. Le valutazioni nel mondo reale mostrano aumenti di 13,30–16,70 punti percentuali nel tasso di successo aggregato su tre compiti, in presenza di configurazioni delle telecamere mai viste, variazioni di illuminazione ed elementi di disturbo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv