Ricerca
Far progredire i grandi modelli di ragionamento oltre la supervisione umana: un percorso verso la superintelligenza
I recenti progressi nei grandi modelli di ragionamento (LRM) hanno dimostrato che l’apprendimento per rinforzo con ricompense verificabili (RLVR) può migliorare notevolmente la capacità di ragionament

- arXiv
- 2608.31075
- Pubblicato
- 2026-08-31
- Autori
- Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo
Abstract degli autori
I recenti progressi nei grandi modelli di ragionamento (LRM) hanno dimostrato che l’apprendimento per rinforzo con ricompense verificabili (RLVR) può migliorare notevolmente la capacità di ragionamento in matematica e nella programmazione, ambiti in cui i risultati possono essere controllati automaticamente. Estendere questi progressi a compiti aperti e che richiedono capacità di agire autonomamente resta difficile, perché ottenere ricompense affidabili è più complicato e la supervisione umana diretta non riesce a tenere il passo con la scala e la complessità delle esperienze generate dai modelli. Questo articolo studia come gli LRM possano continuare a migliorare mentre la supervisione umana si riduce gradualmente nel ciclo di apprendimento. Esaminiamo due dimensioni connesse di questo problema. L’asse delle ricompense segue il passaggio dai giudizi umani su ogni singolo caso a verificatori riutilizzabili e ricompense che funzionano anche senza feedback umano. L’asse dell’esperienza esamina come l’apprendimento possa passare da compiti e ambienti selezionati dagli esseri umani a percorsi di apprendimento generati autonomamente, ambienti costruiti e coevoluzione autonoma. Colleghiamo queste dimensioni attraverso una scala di cinque livelli, da L0 a L4, che individua quali parti del processo di apprendimento restano sotto il controllo umano. La nostra analisi evidenzia inoltre i rischi introdotti da una generazione sempre più autonoma delle ricompense e delle esperienze, tra cui lo sfruttamento delle ricompense, la deriva del feedback, il collasso dei percorsi di apprendimento e gli errori negli ambienti. Di conseguenza, organizziamo anche la valutazione attorno a tre oggetti complementari: le capacità del modello, l’affidabilità del feedback e la qualità delle esperienze. Questa analisi offre un quadro strutturato degli attuali approcci per far progredire gli LRM oltre la supervisione umana e dei problemi ancora aperti nello sviluppo di sistemi di apprendimento autosufficienti verso la superintelligenza. Inoltre, manteniamo un \href{https://github.com/visitworld123/Awesome-Scaling-LRM-Beyond-Human-Supervision}{GitHub repository} continuamente aggiornato per seguire gli sviluppi più recenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv