Vai al contenuto
AI.info

Ricerca

ROSS: riapprendere dalle traiettorie autogenerate attraverso una supervisione selettiva

Il post-addestramento dei grandi modelli linguistici produce traiettorie autogenerate attraverso l’apprendimento per rinforzo e la distillazione on-policy, ma questa esperienza viene spesso considerat

ROSS: riapprendere dalle traiettorie autogenerate attraverso una supervisione selettiva
arXiv
2609.35954
Pubblicato
2026-09-28
Autori
Zhiwei Zhang, Huayu Deng, Fei Zhao, Jiayan Fu, Bin Liang, Kam-Fai Wong, Mu Chuan

Abstract degli autori

Il post-addestramento dei grandi modelli linguistici produce traiettorie autogenerate attraverso l’apprendimento per rinforzo e la distillazione on-policy, ma questa esperienza viene spesso considerata obsoleta quando la policy progredisce. Le traiettorie passate possono restare compatibili con una policy successiva e conservare comportamenti che questa non esprime più in modo affidabile. Tuttavia, possono contenere anche errori, tentativi abbandonati e azioni ridondanti che non andrebbero imitati: serve quindi una supervisione selettiva più granulare. Presentiamo ROSS (Relearning from Self-Generated Rollouts through Selective Supervision), che mantiene come contesto l’intera traiettoria passata, ma applica la funzione di perdita soltanto alle continuazioni selezionate generate dal modello. Nell’apprendimento per rinforzo specifico per dominio, nella distillazione on-policy con più modelli insegnanti e nell’apprendimento per rinforzo degli agenti, ROSS migliora sistematicamente i checkpoint di partenza e supera i metodi di riferimento in matematica, generazione di codice, capacità di seguire istruzioni e ingegneria del software. Con Qwen3.6-35B-A3B, ROSS porta la media dei sei benchmark MOPD dal 58,40% al 62,20% e il risultato su SWE-bench Verified dal 64,20% al 68,40%. Questi risultati mostrano che l’addestramento su traiettorie autogenerate lascia un’esperienza comportamentale riutilizzabile, da cui si possono ottenere ulteriori miglioramenti mediante fine-tuning supervisionato offline (SFT), senza ulteriori traiettorie generate dalla policy.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv