Vai al contenuto
AI.info

Ricerca

Zero-WAM: modellazione in contesto del mondo e delle azioni a partire da video di persone per la generalizzazione a compiti aperti

La generalizzazione zero-shot tra compiti, in cui una policy deve eseguire compiti di manipolazione mai incontrati durante l’addestramento, resta una sfida centrale nell’apprendimento robotico. Nei gr

Zero-WAM: modellazione in contesto del mondo e delle azioni a partire da video di persone per la generalizzazione a compiti aperti
arXiv
2608.26103
Pubblicato
2026-08-26
Autori
Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

Abstract degli autori

La generalizzazione zero-shot tra compiti, in cui una policy deve eseguire compiti di manipolazione mai incontrati durante l’addestramento, resta una sfida centrale nell’apprendimento robotico. Nei grandi modelli linguistici, un nuovo compito può essere svolto semplicemente specificandolo nel contesto, senza aggiornare i parametri. Questa forma di apprendimento in contesto (ICL) trasforma la generalizzazione in un problema di specificazione del compito. Per ottenere la generalizzazione tra compiti, applichiamo questo paradigma alla manipolazione robotica e sosteniamo che il modo naturale di specificare un compito di manipolazione sia un video di una persona: a differenza del linguaggio, offre ricchi indizi visivi su come il compito dovrebbe evolversi. Presentiamo Zero-WAM, un modello causale video-azione che esegue compiti mai incontrati seguendo la guida fornita in contesto da un video di una persona. Per affrontare la scarsità di dati accoppiati persona-robot relativi a una ricca varietà di compiti, proponiamo una procedura automatica che converte traiettorie robotiche campionate per compito in video di persone semanticamente corrispondenti, producendo HumanGen, un dataset di 74,2K coppie persona-robot per l’ICL relative a 8,6K compiti. Per addestrare il modello, introduciamo inoltre un obiettivo di previsione in contesto di segmenti futuri (IFP) che impedisce di sfruttare scorciatoie apprese dai compiti già incontrati e costringe la policy a ricavare le informazioni sul compito dal video usato come prompt. Su sette compiti mai incontrati nella simulazione RoboTwin 2.0, Zero-WAM raggiunge un tasso medio di successo del 47,0%, con un miglioramento assoluto di 29,5 punti percentuali rispetto alla baseline video-azione più efficace. Nelle valutazioni nel mondo reale, segue la guida dei video di persone per generalizzare a configurazioni mai incontrate dei compiti, che comprendono scene con più oggetti, manipolazioni su orizzonti temporali lunghi e inserimenti di precisione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv