Ricerca
Capaci ma parsimoniosi: estrarre e caratterizzare le catene di ragionamento nascoste nei modelli di frontiera
I rapidi progressi nelle capacità dei modelli linguistici di frontiera sono ampiamente attribuiti a migliori capacità di ragionamento. Tuttavia, non è possibile verificarlo, perché nei sistemi closed

- arXiv
- 2609.26637
- Pubblicato
- 2026-09-22
- Autori
- Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li, Johannes Bjerva
Abstract degli autori
I rapidi progressi nelle capacità dei modelli linguistici di frontiera sono ampiamente attribuiti a migliori capacità di ragionamento. Tuttavia, non è possibile verificarlo, perché nei sistemi closed source le tracce grezze di CoT sono nascoste. Registrando un semplice strumento personalizzato tramite una funzionalità standard delle API, induciamo i modelli di frontiera a esternalizzare il ragionamento intermedio. Poiché queste tracce potrebbero riflettere una razionalizzazione a posteriori anziché un ragionamento autentico, per prima cosa le valutiamo confrontandole con il CoT nativo nei modelli open source, per poi estendere l’analisi ai modelli di frontiera closed source, tra cui GPT-6 Astra. Constatiamo che il ragionamento estratto è alla pari con quello nativo in termini di prestazioni e supera ampiamente i baseline senza ragionamento, in matematica da competizione, scienze e generazione di codice. Analizziamo poi come i modelli di frontiera strutturano il ragionamento intermedio. Esaminando l’efficienza nell’uso dei token, i tipi di passaggi di ragionamento e gli alberi di ragionamento indotti, individuiamo differenze sistematiche nel modo in cui i modelli esternalizzano, comprimono e organizzano il ragionamento. Rileviamo che Astra adotta un ragionamento mirato ed efficiente nell’uso dei token: individua prima una traiettoria corretta, risolvendo internamente i passaggi elementari ed esternalizzando soltanto i ragionamenti cruciali. Questi risultati offrono una prospettiva comportamentale sul ragionamento dei modelli di frontiera, oltre i punteggi dei benchmark.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv