Ricerca
SHAPE della catena di pensiero nel ragionamento matematico
I modelli linguistici di grandi dimensioni (LLM) ottengono risultati elevati nei benchmark di ragionamento matematico, ma le competenze matematiche alla base del loro ragionamento restano poco studiat

- arXiv
- 2608.28600
- Pubblicato
- 2026-06-28
- Autori
- Jonghyun Song, Sangjun Song, Minjae Oh, Haesung Pyun, Sungsik Lee, Yohan Jo
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) ottengono risultati elevati nei benchmark di ragionamento matematico, ma le competenze matematiche alla base del loro ragionamento restano poco studiate. Presentiamo \texttt{SHAPE}, un quadro di analisi delle traiettorie di Chain-of-Thought (CoT) basato su due prospettive sviluppate nella didattica della matematica: (1) gli spazi semantici, ossia le interpretazioni matematiche di un problema che il modello elabora via via (per esempio, algebriche o geometriche), e (2) le euristiche, ossia le specifiche operazioni matematiche compiute all’interno di quegli spazi (per esempio, semplificare il problema o procedere a ritroso). Usiamo dapprima \texttt{SHAPE} per analizzare gli schemi di ragionamento di vari modelli. I risultati mostrano che le euristiche matematiche impiegate da un modello spiegano la correttezza della risposta finale meglio delle caratteristiche tradizionali del CoT. Inoltre, è probabile che i modelli arrivino a soluzioni corrette concentrando il proprio sforzo di ragionamento in pochi spazi semantici, anziché esplorarne molti e diversi tra loro: uno schema coerente con il comportamento umano. Usiamo poi la prospettiva di \texttt{SHAPE} per valutare se il post-addestramento migliori davvero la competenza matematica. Riscontriamo che l’apprendimento per rinforzo induce una tendenza a concentrarsi sulle modalità prevalenti nell’uso delle euristiche. Infine, sottoponiamo gli LLM a post-addestramento promuovendo l’uso di euristiche diverse e dimostriamo che questo approccio migliora l’accuratezza. Nel complesso, \texttt{SHAPE} offre un quadro diagnostico fondato sulla teoria per decifrare il ragionamento degli LLM e indica una nuova strada per il post-addestramento degli LLM nel ragionamento matematico. Il codice del nostro modello è disponibile all’indirizzo https://github.com/holi-lab/SHAPE-of-CoT
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv