Vai al contenuto
AI.info

Ricerca

Imparare a orientare, orientare per vedere: alla scoperta della geometria di RLVR nei modelli linguistici di grandi dimensioni tramite vettori addestrabili

L’apprendimento per rinforzo (RL) è diventato un paradigma fondamentale per migliorare la capacità di ragionamento dei modelli linguistici di grandi dimensioni, ma l’elevata dimensionalità degli aggio

Imparare a orientare, orientare per vedere: alla scoperta della geometria di RLVR nei modelli linguistici di grandi dimensioni tramite vettori addestrabili
arXiv
2609.34344
Pubblicato
2026-09-28
Autori
Yuchen Cai, Ding Cao, Qixiang Yin, Xin Xu, Kai Yang, Siye Wu, Pengyuan Wang, Jiaxuan Wang, Weijie Liu, Saiyong Yang, Guangzhong Sun, Guiquan Liu, Junfeng Fang

Abstract degli autori

L’apprendimento per rinforzo (RL) è diventato un paradigma fondamentale per migliorare la capacità di ragionamento dei modelli linguistici di grandi dimensioni, ma l’elevata dimensionalità degli aggiornamenti dei parametri rende difficile analizzarne le dinamiche di addestramento. Studiamo l’apprendimento per rinforzo con ricompense verificabili (RLVR) e usiamo l’orientamento tramite vettori per individuare, nello spazio delle attivazioni, una varietà efficace a bassa dimensionalità associata ai miglioramenti prodotti da RL. Individuiamo due proprietà geometriche. (1) Capacità della varietà efficace: la capacità necessaria per riprodurre i miglioramenti ottenuti con RL può essere molto ridotta, ma non è comprimibile all’infinito; a capacità estremamente basse, la dimensionalità dell’intervento e la capacità espressiva dipendente dall’input diventano vincoli cruciali, e tale requisito varia con la profondità di iniezione. (2) Separazione della varietà di controllo: le direzioni di controllo efficaci si trovano principalmente nel complemento a bassa varianza del sottospazio principale delle attivazioni. A parità di compito e modello di base, la geometria appresa rimane in larga misura coerente tra diverse configurazioni di addestramento; tra compiti diversi, l’allineamento geometrico è correlato al trasferimento delle capacità. Esperimenti condotti su 5 modelli linguistici di grandi dimensioni e 6 compiti con ricompense verificabili confermano questi risultati. Proponiamo quindi Alpha-Stabler, un framework plug-and-play dotato di un Predictor che monitora l’intrusione nel sottospazio principale per segnalare precocemente il collasso, e di un Controller che, durante la retropropagazione, elimina la componente dei gradienti delle attivazioni nel sottospazio principale preservando il complemento ortogonale. Alpha-Stabler stabilizza l’addestramento per 2.000 passaggi e migliora sistematicamente i risultati ottenuti con RL, offrendo indicazioni pratiche per un post-addestramento robusto. Codice: https://github.com/caiyuchen-ustc/On_Policy_Vector_Training

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv