Vai al contenuto
AI.info

Ricerca

PaperGym: evoluzione incentrata sulle rubriche per la generazione di piani di ricerca

Pianificare la ricerca è la capacità decisiva degli scienziati IA. Un piano di ricerca, però, non ha una risposta verificabile: all’apprendimento per rinforzo manca quindi l’ambiente di cui ha bisogno

PaperGym: evoluzione incentrata sulle rubriche per la generazione di piani di ricerca
arXiv
2608.31119
Pubblicato
2026-08-31
Autori
Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

Abstract degli autori

Pianificare la ricerca è la capacità decisiva degli scienziati IA. Un piano di ricerca, però, non ha una risposta verificabile: all’apprendimento per rinforzo manca quindi l’ambiente di cui ha bisogno, fatto di compiti accompagnati da un valutatore. Le rubriche ricavate dagli articoli scientifici possono svolgere questa funzione. Nei processi esistenti, tuttavia, la domanda e i criteri sono tratti dagli stessi contenuti, perciò la ricompensa può essere ottenuta anche solo parafrasandoli. Inoltre, per ogni rollout la rubrica viene ridotta a un unico valore scalare. Presentiamo PaperGym, un sistema unificato che trasforma ogni articolo scientifico in un ambiente di addestramento completo. PaperGym sfrutta la struttura dell’articolo: la domanda è formulata a partire dall’obiettivo della ricerca e dal contesto, mentre i criteri derivano dal metodo e dagli esperimenti. I criteri riguardano l’innovazione metodologica e la progettazione degli esperimenti; la fuga di informazioni sui criteri scende al 3,7%, contro valori compresi tra l’11,90% e il 34,10% nei dataset esistenti. L’addestramento usa la rubrica due volte: prima come contesto privilegiato per il modello auto-insegnante di OPSD, poi come ricompensa per GRPO. Su Qwen3-1.7B/4B/8B, questa sequenza supera il fine-tuning supervisionato, ciascuna delle due fasi presa singolarmente e l’ordine inverso, migliorando le medie su cinque benchmark rispettivamente di 5,6, 5,0 e 4,8 punti. A parità di procedura, i modelli addestrati su PaperGym-20k vincono il 58,1% dei confronti a tre, contro il 28,2% di RubricHub Science. Il modello Qwen3-8B così addestrato raggiunge un punteggio di 73,48 su ResearchQA, superando Kimi K2.6, molto più grande. Rendiamo disponibili la pipeline, il corpus PaperGym-20k da 20.000 istanze e i benchmark PaperGym-Innov e PaperGym-Design.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv