Vai al contenuto
AI.info

Ricerca

MInTRL: l’intervento off-policy può potenziare l’apprendimento per rinforzo on-policy

L’apprendimento per rinforzo con ricompense verificabili viene in genere condotto on-policy: i dati di addestramento restano vicini alla policy corrente, ma l’apprendimento è limitato alle traiettorie

MInTRL: l’intervento off-policy può potenziare l’apprendimento per rinforzo on-policy
arXiv
2609.12419
Pubblicato
2026-09-11
Autori
Mingyu Chen, Yefan Tao, Gerald Friedland, Xuezhou Zhang, Chris Kong

Abstract degli autori

L’apprendimento per rinforzo con ricompense verificabili viene in genere condotto on-policy: i dati di addestramento restano vicini alla policy corrente, ma l’apprendimento è limitato alle traiettorie che la policy riesce a scoprire da sola. I metodi off-policy, come il fine-tuning supervisionato, possono invece sfruttare conoscenze esterne che vanno oltre le capacità del modello di base, ma rischiano di risentire di un forte cambiamento della distribuzione. La sfida è quindi ampliare l’esplorazione senza compromettere la possibilità di apprendere. In questo lavoro presentiamo Minimal Intervention Reinforcement Learning (MInTRL), che estende la frontiera dell’esplorazione con interventi sporadici e locali in rollout per il resto on-policy. Durante la generazione, una policy di valutazione e intervento esamina periodicamente l’output della policy corrente, sostituisce le porzioni finali errate con brevi correzioni e restituisce subito il controllo alla policy. Durante l’addestramento, MInTRL adotta una funzione obiettivo di regressione del vantaggio a livello di sequenza che elimina la necessità dell’importance sampling. Mostriamo che interventi sporadici e locali possono migliorare sensibilmente la copertura rispetto al campionamento on-policy con un budget finito, preservando al tempo stesso la natura complessivamente on-policy delle traiettorie risultanti. Nei benchmark di matematica e programmazione, MInTRL supera sistematicamente i metodi di riferimento standard sia on-policy sia off-policy. Gli studi di ablazione mostrano che MInTRL resta efficace con l’autointervento e con diverse policy di valutazione, mentre le prestazioni raggiungono il massimo con un’intensità di intervento moderata, a conferma dell’importanza di intervenire il meno possibile. Questi risultati indicano che l’intervento minimo è un paradigma efficace per migliorare l’apprendimento per rinforzo on-policy.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv