Ricerca
PaperCompiler: generazione fedele di codice a partire da articoli scientifici mediante la compilazione di specifiche a livello di repository
Tradurre fedelmente gli articoli scientifici in implementazioni a livello di repository resta difficile: gli articoli spesso descrivono i metodi a grandi linee, lasciano implicite le assunzioni sull’i

- arXiv
- 2609.02272
- Pubblicato
- 2026-09-02
- Autori
- Yunhao Liu, Hong Phuc Pham, Jaehong Yoon
Abstract degli autori
Tradurre fedelmente gli articoli scientifici in implementazioni a livello di repository resta difficile: gli articoli spesso descrivono i metodi a grandi linee, lasciano implicite le assunzioni sull’implementazione e richiedono che i repository generati preservino la logica dei metodi, i protocolli di valutazione e la coerenza tra i file. Nonostante i recenti progressi degli agenti che generano codice a partire da articoli, i loro risultati intermedi sono spesso presentati come piani o riepiloghi in forma libera, che gli agenti incaricati di scrivere il codice nelle fasi successive possono ignorare, reinterpretare o comprimere. Questo può portare a semplificazioni degli algoritmi e a strutture dei repository incoerenti. Per affrontare queste difficoltà, presentiamo PaperCompiler, un framework che genera codice a partire da articoli scientifici compilando le evidenze tratte dagli articoli in specifiche esplicite per l’implementazione a livello di repository. PaperCompiler individua le evidenze rilevanti per l’implementazione, preservandone la provenienza e distinguendo le informazioni supportate dall’articolo, quelle inferite, quelle delegate all’esterno e quelle ancora irrisolte. Le specifiche risultanti definiscono requisiti di non degradazione, attribuzioni di responsabilità, dipendenze tra file e vincoli a livello di file. La generazione del repository segue queste specifiche compilate, mantenendo flessibilità nelle scelte ingegneristiche locali non fissate dall’articolo. Su Paper2CodeBench, PaperCompiler supera solide baseline, ottenendo un miglioramento relativo del 13,8% nella fedeltà rispetto a un riferimento (da 3,64 a 4,15) e riducendo le critiche di gravità elevata espresse dai valutatori (dal 13,2% al 6,1%).
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv