Ricerca
Una ricetta aperta per l’oro alle IMO: addestrare Nemotron per la matematica olimpica
Studiamo come il post-addestramento dei modelli e la progettazione dell’inferenza in fase di test influenzino la generazione di dimostrazioni in linguaggio naturale per problemi difficili di matematic

- arXiv
- 2609.10712
- Pubblicato
- 2026-09-09
- Autori
- Ivan Moshkov, Stephen Ge, George Armstrong, Wei Du, Sadegh Mahdavi, Igor Gitman
Abstract degli autori
Studiamo come il post-addestramento dei modelli e la progettazione dell’inferenza in fase di test influenzino la generazione di dimostrazioni in linguaggio naturale per problemi difficili di matematica olimpica. Partendo da Nemotron 3 Ultra, addestriamo due checkpoint specializzati mediante fine-tuning supervisionato e apprendimento per rinforzo, e valutiamo la scelta dei checkpoint, la verifica e il perfezionamento. Sulla base di questi risultati, presentiamo una pipeline di calcolo in fase di test basata su modelli aperti. Il sistema opera interamente in linguaggio naturale, senza dimostratori formali, strumenti esterni né accesso a Internet. Tre checkpoint di Nemotron 3 Ultra — il modello in disponibilità generale e due specialisti sottoposti a post-addestramento — alimentano una ricerca iterativa che genera, verifica e perfeziona dimostrazioni candidate; una fase separata, ad alto impiego di risorse computazionali, seleziona poi ciascuna soluzione finale da presentare. Il sistema ha ottenuto 30 punti su 42 alle IMO 2026, raggiungendo la soglia per la medaglia d’oro. Rendiamo disponibili i due checkpoint sottoposti a post-addestramento, insieme ai dati di addestramento, al codice per l’addestramento e l’inferenza, alle soluzioni presentate e a Nemotron-IMO-Bench, un nuovo benchmark composto da 200 problemi inediti di livello olimpico.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv