Ricerca
Ripensare le tracce complete di ragionamento per il post-training
I modelli linguistici di grandi dimensioni (LLM) vengono spesso sottoposti a post-training su traiettorie di ragionamento raccolte in precedenza per migliorarne la capacità di ragionamento. Queste tra

- arXiv
- 2609.07103
- Pubblicato
- 2026-09-07
- Autori
- Jaehui Hwang, Sangdoo Yun, Byeongho Heo, Dongyoon Han
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) vengono spesso sottoposti a post-training su traiettorie di ragionamento raccolte in precedenza per migliorarne la capacità di ragionamento. Queste traiettorie tendono a essere lunghe perché seguono percorsi complessi e intrecciati, che spesso comprendono deviazioni lungo il cammino verso la risposta. Tuttavia, è stato poco studiato se gli LLM traggano davvero beneficio dall’apprendimento di traiettorie complete durante il post-training, per esempio nel fine-tuning supervisionato (SFT). A partire dal nostro studio pilota, rileviamo che le traiettorie complete offrono solo benefici limitati, mentre quelle parziali sono efficaci anche quando vengono fortemente troncate. Analizziamo la ridondanza nelle traiettorie di ragionamento attraverso analisi basate sull’attenzione e studi controllati sulla rimozione di token: entrambi mostrano che i token intermedi contribuiscono in misura minima alla qualità finale del ragionamento. Questo suggerisce che evitare le informazioni ridondanti possa consentire agli LLM di elaborare internamente alternative coerenti, inferendo i passaggi mancanti dalle proprie conoscenze interne quando sono noti gli estremi della traiettoria. Mostriamo inoltre che addestrare gli LLM usando gli estremi delle traiettorie produce cambiamenti sistematici nel comportamento di ragionamento e apporta benefici anche ai metodi di post-training basati sull’apprendimento per rinforzo o sulla distillazione on-policy. Questi risultati evidenziano la necessità di ripensare l’uso delle tracce complete di ragionamento. Il codice è disponibile all’indirizzo https://github.com/naver-ai/revisiting-trace.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv