Ricerca
Generalizzazione composizionale per braccio nei modelli visione-linguaggio-azione a due bracci
La generalizzazione nella collaborazione tra più bracci può essere studiata osservando come abilità atomiche già note vengano combinate in modi nuovi tra i bracci. Tuttavia, le valutazioni esistenti o

- arXiv
- 2610.06184
- Pubblicato
- 2026-10-05
- Autori
- Zaibin Zhang, Binghao Ran, Yuhan Wu, Zhongbo Zhang, Yifan Wang, Junwei Jiang, Junlan Xiao, Wangcheng Shi, Li Kang, Yiran Qin, Zhenfei Yin, Lijun Wang, Huchuan Lu
Abstract degli autori
La generalizzazione nella collaborazione tra più bracci può essere studiata osservando come abilità atomiche già note vengano combinate in modi nuovi tra i bracci. Tuttavia, le valutazioni esistenti offrono indicazioni limitate su quali scelte di addestramento e architettura favoriscano questa capacità in presenza di diversi requisiti di coordinamento. Presentiamo \textbf{ACG-Bench}, un benchmark per la \emph{generalizzazione composizionale per braccio} che offre un ambiente di prova comune per studiare la ricombinazione delle abilità nelle policy a due bracci. Comprende 23 coppie compito--condizione distribuite in 8 famiglie di compiti, con 6 condizioni appartenenti al dominio di addestramento e 17 composizioni mai viste che coprono il riordinamento, la sincronizzazione, la loro combinazione e la composizione tra compiti diversi. Tutti i metodi ricevono gli stessi prompt atomici per ciascun braccio; per riuscire devono raggiungere l’obiettivo del compito rispettando le tappe fisiche e i vincoli specificati di ordine o tempistica. Usando $π_{0.5}$ come architettura di base visione-linguaggio-azione comune, confrontiamo strategie rappresentative di aumento dei dati e scelte architetturali, con gli stessi dati di partenza e un protocollo di valutazione comune. Il nostro studio delle architetture esamina il raggruppamento dei token per braccio, gli adattatori LoRA specifici per abilità (SkillLoRA) e l’attenzione per braccio (AWA), mettendo in evidenza la complementarità tra parametri condizionati dalle abilità e struttura dell’attenzione. La combinazione di queste scelte dà origine a \textbf{AE-VLA}, che raggiunge un tasso di successo nella generalizzazione del 21,53\% in simulazione, rispetto al 2,94\% di Single $π_{0.5}$, al 3,06\% di MA-VLA e al 5,53\% di due policy $π_{0.5}$ controllate indipendentemente. Sui robot fisici SO101, AE-VLA raggiunge un tasso di successo medio del 39,00\% in cinque condizioni mai viste, rispetto al 10,00\% del metodo di riferimento più efficace. Questi risultati offrono indicazioni empiriche per progettare policy a due bracci capaci di generalizzare oltre le routine fisse di addestramento.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv