Vai al contenuto
AI.info

Ricerca

StructRL: apprendimento per rinforzo strutturato online per compiti di visione-linguaggio-azione a lungo termine

I modelli di visione-linguaggio-azione (VLA) ottengono buoni risultati nei compiti di manipolazione più brevi, ma incontrano ancora difficoltà in quelli a lungo termine, che richiedono più manipolazio

StructRL: apprendimento per rinforzo strutturato online per compiti di visione-linguaggio-azione a lungo termine
arXiv
2609.36352
Pubblicato
2026-09-28
Autori
Ziyi Yin, Sangmin Woo, Kang Zhou, Sungyeon Kim, Aosong Feng, Haibo Ding, Jun Huan

Abstract degli autori

I modelli di visione-linguaggio-azione (VLA) ottengono buoni risultati nei compiti di manipolazione più brevi, ma incontrano ancora difficoltà in quelli a lungo termine, che richiedono più manipolazioni dipendenti l’una dall’altra a partire da un unico comando. L’apprendimento per rinforzo (RL) online può migliorare questi modelli attraverso l’interazione con l’ambiente, ma molti metodi esistenti assegnano una ricompensa solo quando l’intero compito viene completato con successo. Questa supervisione finale, però, è sporadica e non distingue i fallimenti iniziali dalle esecuzioni che compiono progressi parziali sostanziali. Proponiamo StructRL, un framework di RL online che costruisce una supervisione intermedia strutturata a partire dal completamento verificabile dei sottocompiti. StructRL scompone ogni compito in sottocompiti verificabili, assegna ricompense intermedie solo dopo il completamento dei sottocompiti necessari e commisura ciascuna ricompensa alla rapidità di completamento. Su RoboCasa365 e LIBERO-Long, con GR00T-N1.5 e pi 0.5, StructRL supera sistematicamente i metodi di riferimento di RL online valutati. Questi risultati mostrano che ricompense intermedie verificabili e strutturate migliorano il post-addestramento dei modelli VLA per compiti a lungo termine. Il codice è disponibile all’indirizzo https://github.com/amazon-science/StructRL.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv