Vai al contenuto
AI.info

Ricerca

World Action Agent: sfruttare i VLM per la manipolazione robotica tramite World Action Rehearsal

I modelli visione-linguaggio (VLM) di uso generale apportano conoscenze ampie e capacità di ragionamento spaziale alla manipolazione robotica. I sistemi esistenti, però, li usano indirettamente, per p

World Action Agent: sfruttare i VLM per la manipolazione robotica tramite World Action Rehearsal
arXiv
2609.29964
Pubblicato
2026-09-24
Autori
Yehang Zhang, Haojian Huang, Yifan Chang, Jianchong Su, Bohan Zhou, Yingjie Xu, Wosong Chen, Tianhao Zhou, Chenxu Wang, Tianyi Zhang, Yangkai Wei, Wenqian Li, Shiyuan Deng, Yinchuan Li, Ying-Cong Chen, Zexi Li

Abstract degli autori

I modelli visione-linguaggio (VLM) di uso generale apportano conoscenze ampie e capacità di ragionamento spaziale alla manipolazione robotica. I sistemi esistenti, però, li usano indirettamente, per prevedere vincoli o scrivere programmi, oppure mostrano loro una vista della scena anziché un mondo in cui agire. Presentiamo World Action Agent (WAA), un’infrastruttura multiagente che consente ai VLM di pilotare robot con strumenti di base, prendendo ogni decisione all’interno di uno spazio di lavoro visivo per le azioni. Questo spazio ha tre caratteristiche. Le viste del contatto, selezionate automaticamente in base alla geometria della scena, mostrano l’area intorno all’interazione in corso. La simulazione delle azioni trasforma ogni azione in una proposta modificabile che l’agente, da solo o tramite un Imagination Agent, visualizza in anteprima e rivede alla luce del feedback sulla pianificazione prima dell’esecuzione. La correzione nella vista chiude il ciclo tra osservazione, simulazione ed esecuzione a basso livello, consentendo all’agente di eliminare gli scostamenti residui nella vista in cui li osserva. Attraverso lo stesso spazio di lavoro, WAA acquisisce conoscenze procedurali legate all’interazione con l’ambiente in due modi: sviluppa abilità multimodali a partire da video di esperti e dall’insegnamento umano, sottoponendole a una revisione basata sulle evidenze, e le consulta tramite uno Skill Agent; inoltre, le tracce delle sue interazioni vengono usate per addestrare VLM più piccoli a pilotare la stessa infrastruttura. Su LIBERO-Pro, WAA, con abilità sviluppate esclusivamente a partire da LIBERO-90, raggiunge un tasso medio di successo del 75,6%, il migliore allo stato dell’arte, superando i VLA end-to-end, gli agenti che usano codice come politica e una baseline basata su un’infrastruttura visiva con lo stesso backbone. Le stesse abilità rimangono efficaci su robosuite senza ulteriore apprendimento. Il fine-tuning di Qwen3.5-9B sulle tracce dell’infrastruttura porta il suo tasso di successo fuori dominio dall’1,7% al 43,3%.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv