Vai al contenuto
AI.info

Ricerca

Gli ambienti come impalcatura: arricchire il feedback per avviare l’evoluzione autonoma degli agenti nei compiti a lungo termine

I modelli linguistici di grandi dimensioni mostrano una notevole capacità di ragionamento statico, ma addestrarli come agenti autonomi mediante apprendimento per rinforzo (RL) per compiti a lungo term

Gli ambienti come impalcatura: arricchire il feedback per avviare l’evoluzione autonoma degli agenti nei compiti a lungo termine
arXiv
2609.08404
Pubblicato
2026-09-08
Autori
Hongbang Yuan, Zhuoran Jin, Yixin Cao

Abstract degli autori

I modelli linguistici di grandi dimensioni mostrano una notevole capacità di ragionamento statico, ma addestrarli come agenti autonomi mediante apprendimento per rinforzo (RL) per compiti a lungo termine è spesso ostacolato dalla forte scarsità delle ricompense. Sebbene il convenzionale \textit{agent-side warming} up tramite fine-tuning supervisionato (SFT) possa attenuare il problema, è spesso limitato dalla scarsità di dati e da vincoli all’esplorazione. Per affrontarlo, proponiamo un cambio di paradigma verso l’\textit{environment-side adaptation}, costruendo \textbf{F}eedback-\textbf{E}nriched \textbf{E}nvironments (\textbf{FEEs}). Attraverso uno studio pilota, definiamo una strategia di progettazione del feedback che riformula gli ambienti passando dalla guida delle azioni all’arricchimento delle osservazioni nelle fasi avanzate sia dell’esplorazione all’interno dei singoli episodi sia dell’evoluzione tra episodi. Esperimenti su larga scala sui benchmark SciWorld e BFCL, condotti con modelli Qwen3 di diverse dimensioni e algoritmi di RL quali GRPO, GSPO e DAPO, mostrano che i FEEs producono sistematicamente miglioramenti delle prestazioni rispetto alle configurazioni standard. Inoltre, la nostra analisi rivela che l’addestramento con i FEEs \textbf{(1)} stabilizza la dinamica dell’addestramento riducendo la volatilità dell’entropia, \textbf{(2)} favorisce l’esplorazione proattiva dello spazio degli stati nei compiti difficili, \textbf{(3) }fa sì che le indicazioni fornite dall’ambiente vengano incorporate nei pesi della policy, anziché agire soltanto come prior al momento dell’inferenza, e \textbf{(4) }individua nella coerenza del feedback all’interno del gruppo un limite cruciale per un’ottimizzazione stabile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv