Ricerca
StudyBench: l’autoevoluzione può trarre dai libri di testo le capacità necessarie per affrontare le olimpiadi?
Agli esseri umani bastano pochi libri di testo ben scritti per padroneggiare una disciplina e cimentarsi con i suoi problemi più difficili. Sosteniamo che un metodo ideale di autoevoluzione dovrebbe a

- arXiv
- 2609.00787
- Pubblicato
- 2026-09-01
- Autori
- Yinghao Chen, Zixi Chen, Bingxiang He, Ziqing Qiao, Huan-ang Gao, Yinuo Xu, Yuxin Zuo, Zeyuan Liu, Yuhao Zhan, Chaojun Xiao
Abstract degli autori
Agli esseri umani bastano pochi libri di testo ben scritti per padroneggiare una disciplina e cimentarsi con i suoi problemi più difficili. Sosteniamo che un metodo ideale di autoevoluzione dovrebbe avere la stessa proprietà: imparare autonomamente dal materiale di addestramento grezzo e sviluppare capacità di risoluzione dei problemi trasferibili ad altri contesti. Tuttavia, non disponiamo ancora di una misura diretta di questa proprietà. Presentiamo StudyBench, un benchmark controllato di fisica che misura direttamente l’efficienza con cui un metodo di autoevoluzione trasforma il materiale di addestramento in capacità. Suddividiamo il set di test in un Application Set, composto da problemi difficili tratti dai libri di testo e volto a valutare la capacità di assimilazione, e un Transfer Set, composto da problemi di livello olimpico e volto a valutare la capacità di trasferimento. Valutando con il benchmark metodi rappresentativi di autoevoluzione su tre modelli di base, scopriamo che i miglioramenti nell’Application Set raramente si traducono in miglioramenti nel più difficile Transfer Set. Uno studio di ablazione della guida mette in luce un Guidance Gap: anche il metodo più efficace colma solo una piccola parte del divario rispetto a ciò che lo stesso materiale permette di ottenere quando viene fornito come guida nel contesto. Inoltre, tutti i metodi raggiungono un Compute Plateau: le loro prestazioni si stabilizzano ben prima che esauriscano il budget di calcolo. Il divario che rimane dipende quindi dal metodo, non dai dati o dal calcolo. Offrendo un benchmark chiaro e controllato, StudyBench trasforma i progressi nell’autoevoluzione da una ricerca senza un traguardo definito in un obiettivo misurabile per la ricerca futura. Il nostro codice è disponibile all’indirizzo https://github.com/thunlp/StudyBench.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv