Vai al contenuto
AI.info

Ricerca

DiVeR: apprendimento del verificatore orientato alle decisioni cruciali per lo scaling dei VLA in fase di test

L’aumento dei dati robotici e della capacità dei modelli ha migliorato le politiche Vision-Language-Action (VLA), ma ulteriori progressi sono limitati dal costo elevato dei dati robotici. Lo scaling i

DiVeR: apprendimento del verificatore orientato alle decisioni cruciali per lo scaling dei VLA in fase di test
arXiv
2610.04933
Pubblicato
2026-10-04
Autori
Seongheon Park, Heecheol Kim, Shulin Tian, Lilika Makabe, Namiko Saito, Katsushi Ikeuchi, Sharon Li, Yasuyuki Matsushita

Abstract degli autori

L’aumento dei dati robotici e della capacità dei modelli ha migliorato le politiche Vision-Language-Action (VLA), ma ulteriori progressi sono limitati dal costo elevato dei dati robotici. Lo scaling in fase di test guidato da un verificatore offre un’alternativa efficiente: durante l’inferenza campiona più azioni candidate e seleziona quella con maggiori probabilità di portare a termine il compito. I verificatori esistenti basati sulla classificazione apprendono dagli esiti delle traiettorie, ma trattano allo stesso modo tutti gli stati attraversati, benché la loro utilità nel distinguere le azioni candidate possa variare lungo una traiettoria. In molti stati, le azioni plausibili sono simili e offrono poche informazioni per distinguerle; solo un insieme ristretto di stati in cui le decisioni sono cruciali ammette azioni significativamente diverse, capaci di incidere notevolmente sugli esiti successivi. Per affrontare questo problema, proponiamo DiVeR, che stima quanto sia cruciale una decisione dalla dispersione delle rappresentazioni delle azioni campionate. DiVeR usa poi questo segnale per attribuire maggior peso, nell’apprendimento del verificatore, agli stati in cui la scelta dell’azione ha le maggiori conseguenze, senza richiedere annotazioni per ogni passo né ulteriori interazioni con l’ambiente. Negli esperimenti condotti su LIBERO, RoboCasa e nel mondo reale con un robot Franka Research 3, DiVeR migliora costantemente la riuscita dei compiti grazie a una selezione delle azioni più efficace, guidata dal verificatore, aggiungendo un costo computazionale trascurabile all’inferenza del verificatore.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv