Ricerca
Non mascherare l’ambiente: la supervisione delle osservazioni cambia il modo in cui gli agenti esplorano durante l’apprendimento per rinforzo
Le traiettorie degli agenti registrano ciò che fa un agente e ciò che accade in seguito. Eppure, il normale fine-tuning supervisionato (SFT) applica la funzione di perdita solo ai token di azione gene

- arXiv
- 2609.20715
- Pubblicato
- 2026-09-17
- Autori
- Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah
Abstract degli autori
Le traiettorie degli agenti registrano ciò che fa un agente e ciò che accade in seguito. Eppure, il normale fine-tuning supervisionato (SFT) applica la funzione di perdita solo ai token di azione generati dall’agente, usando le osservazioni dell’ambiente come contesto, ma non come obiettivi di previsione. Ci chiediamo se questa convenzione offra la migliore inizializzazione per il successivo apprendimento per rinforzo. Introduciamo ActObs, che supervisiona anche i token delle osservazioni già presenti in ogni traiettoria. Anche se gli agenti in fase di utilizzo non generano mai osservazioni, imparare a prevederle incoraggia la policy a modellare le conseguenze delle azioni senza aggiungere dati, parametri, token di sequenza o passaggi in avanti. Dopo l’SFT, i metodi ottengono risultati simili, ma divergono dopo il GRPO. Su Qwen3-4B, il GRPO a partire da ActObs raggiunge un pass@k più alto a ogni budget di campionamento valutato rispetto alla sua controparte addestrata solo sulle azioni, sul benchmark Terminal-Bench 2.0. Su Qwen3-8B, sacrifica parte dell’affidabilità a pass@1 in cambio di un pass@k più alto (+3,4 punti percentuali a pass@16) e risolve più compiti distinti. Il vantaggio si estende all’editing di codice in un dominio diverso su aider-polyglot (+4,2 punti percentuali a pass@1 con 4B), i cui compiti non erano stati visti durante l’SFT né durante l’RL. ActObs mantiene più entropia durante l’RL richiedendo al contempo un minore spostamento della policy, lasciando la policy finale più vicina alla sua inizializzazione SFT. La nostra analisi riconduce questa differenza all’SFT: i gradienti relativi alle azioni e alle osservazioni diventano rapidamente ortogonali, mentre l’addestramento basato solo sulle azioni lascia un ampio gradiente residuo relativo alle osservazioni e porta la capacità di prevedere l’ambiente al di sotto di quella del modello di base. La supervisione congiunta evita questa specializzazione unilaterale, preservando la previsione delle conseguenze e preparando la policy all’esplorazione successiva.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv