Ricerca
L’elemento primitivo mancante: diagnosi e correzione del ragionamento matematico nei modelli linguistici di grandi dimensioni
Sebbene i modelli linguistici di grandi dimensioni (LLM) abbiano mostrato capacità notevoli nel risolvere problemi matematici di frontiera, non è ancora chiaro se possiedano la comprensione struttural

- arXiv
- 2610.02191
- Pubblicato
- 2026-10-01
- Autori
- Shuo Xing, Zilin Dai, Chengyuan Qian, Fangzhou Lin, Wenjing Chen, Ping He, Pan Lu, Alvaro Velasquez, Mohit Bansal, Zhengzhong Tu
Abstract degli autori
Sebbene i modelli linguistici di grandi dimensioni (LLM) abbiano mostrato capacità notevoli nel risolvere problemi matematici di frontiera, non è ancora chiaro se possiedano la comprensione strutturale della matematica alla base delle loro soluzioni. In questo articolo compiamo un primo passo verso uno studio sistematico della comprensione matematica negli LLM: ne analizziamo le diverse capacità e usiamo i risultati per migliorare il post-training. Per prima cosa, introduciamo il concetto di elemento primitivo matematico per sondare la comprensione strutturale della matematica e proponiamo \hlei{}, un nuovo benchmark che valuta il ragionamento matematico lungo quattro dimensioni distinte: scoperta, generazione, assimilazione ed esecuzione. La nostra analisi sistematica mostra poi che l’accuratezza delle soluzioni nasconde profili di capacità distinti, che gli elementi primitivi sbloccano una notevole capacità latente di esecuzione e che la scoperta è il principale collo di bottiglia del ragionamento matematico. L’analisi del post-training mostra inoltre che gli errori dovuti a limiti nella scoperta si prestano particolarmente a essere corretti. Infine, sulla base di questi risultati, introduciamo \abs{}, un framework di autodistillazione basato sull’accesso privilegiato agli elementi primitivi, che trasferisce selettivamente nel modello studente il ragionamento guidato da tali elementi. Numerosi esperimenti dimostrano che \abs{} migliora costantemente il ragionamento matematico rispetto alle baseline, con modelli di diverse dimensioni e su benchmark impegnativi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv