Vai al contenuto
AI.info

Ricerca

Rationale-Guided Policy Optimization: imparare a ragionare con un supporto adattivo basato sui ragionamenti esplicativi

L’apprendimento per rinforzo on-policy è diventato un approccio centrale per migliorare le capacità di ragionamento dei modelli linguistici di grandi dimensioni. La sua efficacia, tuttavia, è spesso l

arXiv
2610.07342
Pubblicato
2026-10-05
Autori
Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei

Abstract degli autori

L’apprendimento per rinforzo on-policy è diventato un approccio centrale per migliorare le capacità di ragionamento dei modelli linguistici di grandi dimensioni. La sua efficacia, tuttavia, è spesso limitata dalla sparsità delle ricompense: quando un modello non riesce a individuare traiettorie corrette per problemi difficili, il processo di ottimizzazione riceve pochi segnali utili e può arrestarsi. Gli approcci esistenti attenuano questo problema incorporando dimostrazioni off-policy, tracce fornite da esperti o soluzioni generate da modelli, ma in genere richiedono che i dati ausiliari abbiano lo stesso formato del compito di apprendimento per rinforzo, spesso ricorrendo al campionamento per rigetto da modelli più potenti per ottenere traiettorie di addestramento adatte. Presentiamo Rationale-Guided Policy Optimization (RGPO), un framework che sfrutta in modo adattivo le informazioni sui ragionamenti esplicativi corretti in funzione delle capacità attuali del modello, preservandone al tempo stesso la libertà di esplorazione. Anziché trattare le soluzioni di riferimento come obiettivi fissi da imitare, RGPO le usa come supporti temporanei: i ragionamenti esplicativi aiutano il modello a generare risposte migliori, dopodiché solo le soluzioni generate dal modello che ottengono ricompense più elevate vengono riportate nel contesto originale senza guida. Questa impostazione consente di sfruttare durante l’addestramento le informazioni corrette disponibili senza richiedere che i dati off-policy seguano lo stesso formato del compito di apprendimento per rinforzo. Sia nei compiti di ragionamento basati solo sul linguaggio sia in quelli che combinano visione e linguaggio, RGPO migliora sistematicamente le prestazioni rispetto ai modelli di riferimento RLVR, e gli studi di ablazione mostrano che la guida adattiva basata sui ragionamenti esplicativi contribuisce in modo determinante a questi miglioramenti. I risultati indicano che RGPO offre un approccio pratico e generale per ridurre la sparsità delle ricompense, stabilizzare l’apprendimento per rinforzo e migliorare le prestazioni di ragionamento sia nei modelli basati solo sul testo sia in quelli multimodali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv