Ricerca
RoboFollow: il miraggio del seguire le istruzioni negli agenti incarnati
Gli agenti incarnati moderni raggiungono tassi di successo impressionanti, ma la loro effettiva capacità di seguire le istruzioni è molto più limitata di quanto suggeriscano questi numeri. Ricondducib

- arXiv
- 2609.25636
- Pubblicato
- 2026-09-22
- Autori
- Chang Guo, Yukun Xie, Bohan Tan, Zheng Chang, Zhaokai Yin, Qianli Ma, Yingqiao Wang, Chao Liang, Zhipeng Zhang
Abstract degli autori
Gli agenti incarnati moderni raggiungono tassi di successo impressionanti, ma la loro effettiva capacità di seguire le istruzioni è molto più limitata di quanto suggeriscano questi numeri. Ricondducibile a una proprietà strutturale che chiamiamo bassa entropia della scena, questa illusione si verifica quando una scena visiva ammette un solo compito valido: il linguaggio diventa ridondante e una policy può ottenere punteggi elevati pur utilizzandolo a malapena. Presentiamo RoboFollow, un benchmark diagnostico basato su tre principi: (1) Alta entropia della scena: ogni scena di addestramento supporta più diramazioni del compito, cinematicamente distinte, per cui la sola visione non basta e diventa necessario affidarsi al linguaggio. (2) Protocollo diagnostico gerarchico: un protocollo a quattro livelli (L0--L3) modifica progressivamente la disposizione visiva e la semantica, per verificare se istruzioni equivalenti producono comportamenti coerenti e istruzioni diverse producono comportamenti distinguibili, in relazione a rapporti spaziali, attributi, vincoli sulle traiettorie e logica. (3) Diagnosi con fattori confondenti controllati: semplifichiamo gli oggetti con cui si interagisce, limitiamo le azioni al repertorio appreso e riportiamo punteggi di Intenzione ed Esecuzione per ciascuna fase, così da isolare la comprensione dall’esecuzione motoria. La valutazione di nove policy VLA e WAM mostra che, quando si ottengono, buone prestazioni a L0 non si trasferiscono in modo affidabile a L1--L3 con la nostra configurazione di fine-tuning. Le misure correttive esaminate, tra cui backbone VLM più potenti, co-addestramento con QA, LangForce e Classifier-Free Guidance, non riescono a colmare questo divario. RoboFollow porta alla luce la capacità effettiva di seguire le istruzioni, un collo di bottiglia cruciale e trascurato. Il codice e il dataset sono disponibili su https://github.com/AutoLab-SAI-SJTU/RoboFollow e https://huggingface.co/datasets/AutoLab-SJTU/robofollow-data.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv