Ricerca
MInTRL: l’intervento off-policy può potenziare l’apprendimento per rinforzo on-policy
L’apprendimento per rinforzo con ricompense verificabili viene in genere condotto on-policy: i dati di addestramento restano vicini alla policy corrente, ma l’apprendimento è limitato alle traiettorie

- arXiv
- 2609.12419
- Pubblicato
- 2026-09-11
- Autori
- Mingyu Chen, Yefan Tao, Gerald Friedland, Xuezhou Zhang, Chris Kong
Abstract degli autori
L’apprendimento per rinforzo con ricompense verificabili viene in genere condotto on-policy: i dati di addestramento restano vicini alla policy corrente, ma l’apprendimento è limitato alle traiettorie che la policy riesce a scoprire da sola. I metodi off-policy, come il fine-tuning supervisionato, possono invece sfruttare conoscenze esterne che vanno oltre le capacità del modello di base, ma rischiano di risentire di un forte cambiamento della distribuzione. La sfida è quindi ampliare l’esplorazione senza compromettere la possibilità di apprendere. In questo lavoro presentiamo Minimal Intervention Reinforcement Learning (MInTRL), che estende la frontiera dell’esplorazione con interventi sporadici e locali in rollout per il resto on-policy. Durante la generazione, una policy di valutazione e intervento esamina periodicamente l’output della policy corrente, sostituisce le porzioni finali errate con brevi correzioni e restituisce subito il controllo alla policy. Durante l’addestramento, MInTRL adotta una funzione obiettivo di regressione del vantaggio a livello di sequenza che elimina la necessità dell’importance sampling. Mostriamo che interventi sporadici e locali possono migliorare sensibilmente la copertura rispetto al campionamento on-policy con un budget finito, preservando al tempo stesso la natura complessivamente on-policy delle traiettorie risultanti. Nei benchmark di matematica e programmazione, MInTRL supera sistematicamente i metodi di riferimento standard sia on-policy sia off-policy. Gli studi di ablazione mostrano che MInTRL resta efficace con l’autointervento e con diverse policy di valutazione, mentre le prestazioni raggiungono il massimo con un’intensità di intervento moderata, a conferma dell’importanza di intervenire il meno possibile. Questi risultati indicano che l’intervento minimo è un paradigma efficace per migliorare l’apprendimento per rinforzo on-policy.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv