Vai al contenuto
AI.info

Ricerca

Apprendimento robotico in contesto con agenti VLM

Permettere ai robot di adattarsi ad ambienti sconosciuti con la stessa facilità degli esseri umani resta un obiettivo estremamente ambizioso dell’IA incarnata. Nessuna raccolta finita di dimostrazioni

Apprendimento robotico in contesto con agenti VLM
arXiv
2609.19138
Pubblicato
2026-09-16
Autori
Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng, Yixuan Li, Gengxiong Zhuang, Rongze Wang, Shuai Yang, Wei Song, Weizhi Xue, Minyan Wu, Jie Gui, Jiaqi Wang, Tong Wu

Abstract degli autori

Permettere ai robot di adattarsi ad ambienti sconosciuti con la stessa facilità degli esseri umani resta un obiettivo estremamente ambizioso dell’IA incarnata. Nessuna raccolta finita di dimostrazioni può coprire ogni compito e situazione che un robot incontrerà: per generalizzare, è quindi essenziale che sappia apprendere dal contesto al momento dell’impiego. Questo apprendimento in contesto (ICL), tuttavia, resta in gran parte fuori dalla portata delle policy robotiche esistenti. Le ampie capacità come agenti dei modelli commerciali visione-linguaggio (VLM), come GPT-6 Astra, sollevano una domanda: questi modelli possono apprendere da dimostrazioni, esempi e feedback delle interazioni, per poi tradurre tali informazioni in un comportamento robotico eseguibile e verificabile a partire da un nuovo stato iniziale, senza aggiornamenti dei gradienti né modifiche persistenti ai parametri specifici del compito? Presentiamo GPT-Policy, un framework con un agente generalista per l’apprendimento robotico in contesto. GPT-Policy integra un compilatore del contesto che conserva le transizioni visive pertinenti al compito, un VLM che propone azioni per gli strumenti del robot e un controller vincolato che verifica ed esegue ogni azione e ne comunica l’esito. Ne valutiamo l’affidabilità e i limiti attraverso metriche di successo ed efficienza nei compiti, confronti tra modelli a parità di condizioni e studi controllati di ablazione del contesto. Nelle prove con robot reali, le dimostrazioni video effettuate da esseri umani migliorano il completamento dei compiti anche senza etichette delle azioni del robot, mentre i riferimenti alle azioni allineati producono ulteriori miglioramenti nei compiti sensibili al contatto. Questi risultati fanno di GPT-Policy un passo verso l’adattamento dei robot attraverso l’apprendimento in contesto: offrono una base empirica per tradurre le capacità generali dei VLM in comportamenti fisici e chiariscono le sfide da superare per un impiego affidabile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv