Vai al contenuto
AI.info

Ricerca

Post-addestramento dei modelli linguistici per prestazioni da medaglia d’oro nelle competizioni di programmazione

La programmazione competitiva è diventata un banco di prova fondamentale per il ragionamento dei modelli linguistici di grandi dimensioni, e le competizioni internazionali come IOI e ICPC ne rappresen

Post-addestramento dei modelli linguistici per prestazioni da medaglia d’oro nelle competizioni di programmazione
arXiv
2609.02849
Pubblicato
2026-09-02
Autori
Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg

Abstract degli autori

La programmazione competitiva è diventata un banco di prova fondamentale per il ragionamento dei modelli linguistici di grandi dimensioni, e le competizioni internazionali come IOI e ICPC ne rappresentano i contesti più impegnativi. Presentiamo un processo completo di specializzazione che combina la selezione di problemi su larga scala, tracce sintetiche di ragionamento, fine-tuning supervisionato (SFT) e apprendimento per rinforzo (RL). Utilizzando 22.000 problemi selezionati, addestriamo Nemotron-3-Nano-CC (30B-A3B) con SFT e RL e Nemotron-3-Ultra-CC (550B-A55B) con il solo SFT. Introduciamo inoltre GenCorrect, una strategia di calcolo in fase di test basata sul feedback che genera, valuta e perfeziona iterativamente soluzioni diverse. Su IOI 2025, Nano-CC passa da 130 a 291 punti dopo il post-addestramento e a 468 con GenCorrect, superando la soglia di 438,3 punti per la medaglia d’oro, mentre Ultra-CC raggiunge 502 punti. Sulla base di questi risultati, sviluppiamo un sistema Ultra-CC specifico per le competizioni e lo valutiamo prospetticamente durante IOI 2026. Sottoposto agli stessi vincoli di tempo, accesso a Internet e invio delle soluzioni dei concorrenti umani, ottiene 535,4 punti su 600, superando sia la soglia di 361,12 punti per la medaglia d’oro sia il punteggio più alto ottenuto da un concorrente umano, pari a 498,27. Per quanto ne sappiamo, è il primo sistema di IA a ottenere, su una serie di problemi dell’IOI, un punteggio superiore a quello del concorrente umano con il punteggio più alto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv