Vai al contenuto
AI.info

Ricerca

La struttura a basso rango dell’apprendimento per rinforzo nei modelli VLA

L’apprendimento per rinforzo (RL) è sempre più utilizzato nell’addestramento successivo dei modelli di visione-linguaggio-azione (VLA), ma si comprende ancora poco come modifichi le loro politiche. Os

La struttura a basso rango dell’apprendimento per rinforzo nei modelli VLA
arXiv
2609.34599
Pubblicato
2026-09-28
Autori
Minjae Oh, Yoonah Park, Jongwon Lim, Yohan Jo

Abstract degli autori

L’apprendimento per rinforzo (RL) è sempre più utilizzato nell’addestramento successivo dei modelli di visione-linguaggio-azione (VLA), ma si comprende ancora poco come modifichi le loro politiche. Osserviamo che, in modelli VLA basati sul flusso ampiamente utilizzati, tra cui $π_{0.5}$ e GR00T~N1.5/N1.6, l’RL applicato a LIBERO, ManiSkill, MetaWorld e CALVIN produce aggiornamenti dei parametri di rango nettamente inferiore, fortemente concentrati nei Timestep Modules dell’esperto delle azioni: una componente piccola e finora trascurata. Attraverso esperimenti sistematici di sostituzione dei moduli, mostriamo inoltre che questi moduli sono responsabili di una quota sproporzionata dei miglioramenti delle prestazioni ottenuti con l’RL. Esaminiamo poi che cosa codificano i Timestep Modules. Innanzitutto, mostriamo che l’RL li specializza per i passi temporali discreti di denoising utilizzati durante i rollout e che l’addestramento su questi passi temporali discreti è alla base degli aggiornamenti a basso rango. In secondo luogo, rileviamo che, tra i loro output, il vettore di traslazione è quello che cambia più nettamente con l’RL e, mediante analisi mirate, mostriamo che le direzioni dei suoi aggiornamenti predicono con grande accuratezza il successo nei compiti (ROC-AUC fino a $99.6\%$). In terzo luogo, rileviamo che la geometria degli aggiornamenti del vettore di traslazione riflette le relazioni tra i compiti, poiché la loro somiglianza a coppie è correlata alle modalità di trasferimento tra compiti. Sulla base di questi risultati, mostriamo che orientare le politiche lungo le direzioni di aggiornamento del vettore di traslazione migliora ulteriormente le politiche addestrate con l’RL, senza ulteriore addestramento con RL. Nel complesso, offriamo una comprensione sistematica di come l’RL modifichi le politiche VLA studiando il modo in cui i segnali appresi sono codificati nello spazio dei parametri, con indicazioni per un addestramento successivo dei modelli VLA più efficiente e interpretabile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv