Ricerca
Apprendimento robotico in contesto con agenti VLM
Permettere ai robot di adattarsi ad ambienti sconosciuti con la stessa facilità degli esseri umani resta un obiettivo estremamente ambizioso dell’IA incarnata. Nessuna raccolta finita di dimostrazioni

- arXiv
- 2609.19138
- Pubblicato
- 2026-09-16
- Autori
- Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng, Yixuan Li, Gengxiong Zhuang, Rongze Wang, Shuai Yang, Wei Song, Weizhi Xue, Minyan Wu, Jie Gui, Jiaqi Wang, Tong Wu
Abstract degli autori
Permettere ai robot di adattarsi ad ambienti sconosciuti con la stessa facilità degli esseri umani resta un obiettivo estremamente ambizioso dell’IA incarnata. Nessuna raccolta finita di dimostrazioni può coprire ogni compito e situazione che un robot incontrerà: per generalizzare, è quindi essenziale che sappia apprendere dal contesto al momento dell’impiego. Questo apprendimento in contesto (ICL), tuttavia, resta in gran parte fuori dalla portata delle policy robotiche esistenti. Le ampie capacità come agenti dei modelli commerciali visione-linguaggio (VLM), come GPT-6 Astra, sollevano una domanda: questi modelli possono apprendere da dimostrazioni, esempi e feedback delle interazioni, per poi tradurre tali informazioni in un comportamento robotico eseguibile e verificabile a partire da un nuovo stato iniziale, senza aggiornamenti dei gradienti né modifiche persistenti ai parametri specifici del compito? Presentiamo GPT-Policy, un framework con un agente generalista per l’apprendimento robotico in contesto. GPT-Policy integra un compilatore del contesto che conserva le transizioni visive pertinenti al compito, un VLM che propone azioni per gli strumenti del robot e un controller vincolato che verifica ed esegue ogni azione e ne comunica l’esito. Ne valutiamo l’affidabilità e i limiti attraverso metriche di successo ed efficienza nei compiti, confronti tra modelli a parità di condizioni e studi controllati di ablazione del contesto. Nelle prove con robot reali, le dimostrazioni video effettuate da esseri umani migliorano il completamento dei compiti anche senza etichette delle azioni del robot, mentre i riferimenti alle azioni allineati producono ulteriori miglioramenti nei compiti sensibili al contatto. Questi risultati fanno di GPT-Policy un passo verso l’adattamento dei robot attraverso l’apprendimento in contesto: offrono una base empirica per tradurre le capacità generali dei VLM in comportamenti fisici e chiariscono le sfide da superare per un impiego affidabile.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv