Ricerca
TTPO: ottimizzazione della policy in fase di test
I recenti metodi di post-addestramento più importanti, come l’apprendimento per rinforzo (RL) e l’autodistillazione on-policy (OPSD), hanno accelerato i progressi dei grandi modelli linguistici nel ra

- arXiv
- 2608.27448
- Pubblicato
- 2026-08-27
- Autori
- Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen
Abstract degli autori
I recenti metodi di post-addestramento più importanti, come l’apprendimento per rinforzo (RL) e l’autodistillazione on-policy (OPSD), hanno accelerato i progressi dei grandi modelli linguistici nel ragionamento matematico. La loro dipendenza da etichette corrette, però, impedisce l’addestramento in fase di test (TTT). Un’alternativa naturale è sostituire le etichette corrette con pseudo-etichette ottenute tramite voto di maggioranza, ma questa soluzione è fragile: un voto errato compromette il modello insegnante e porta fuori strada ogni token. Osserviamo che questo problema è asimmetrico: i rollout che non concordano con la pseudo-etichetta sono generalmente errati, indipendentemente dal fatto che il voto stesso sia corretto. Sulla base di questa osservazione, proponiamo Test-Time Policy Optimization (TTPO), una funzione obiettivo asimmetrica che applica l’OPSD ai rollout concordi e penalizza quelli discordi con Grouped RL. Una selezione a livello di token affina ulteriormente entrambi i meccanismi: la distillazione riduce il peso delle posizioni che hanno già raggiunto la convergenza, mentre l’RL penalizza solo gli errori commessi con elevata sicurezza. Entrambi gli aggiornamenti restano ben fondati anche quando le pseudo-etichette sono spesso errate, e l’instradamento basato sul voto di maggioranza rende l’autosupervisione più precisa man mano che il modello migliora. Senza alcuna etichetta, TTPO eguaglia l’OPSD supervisionata con etichette su cinque benchmark di livello da competizione, porta Qwen3-1.7B dal 38,0% al 45,2% nel TTT, ottiene miglioramenti dal +25,2% al +36,4% senza ragionamento e mostra una solida capacità di generalizzazione tra compiti diversi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv