Ricerca
ActReview: dati di addestramento guidati dalle repliche degli autori e ricompense basate su rubriche per generare valutazioni tra pari con indicazioni operative
Con il crescente impiego degli LLM per l’autovalutazione degli articoli prima dell’invio, aumenta la richiesta di riscontri che non si limitino a individuare i punti deboli, ma guidino anche gli autor

- arXiv
- 2609.09076
- Pubblicato
- 2026-09-08
- Autori
- Yiling Ma, Yilun Zhao, Sihong Wu, Ziyu Chen, Manasi Patwardhan, Arman Cohan
Abstract degli autori
Con il crescente impiego degli LLM per l’autovalutazione degli articoli prima dell’invio, aumenta la richiesta di riscontri che non si limitino a individuare i punti deboli, ma guidino anche gli autori verso modifiche concrete. Studiamo questo compito come generazione di valutazioni tra pari con indicazioni operative e lo suddividiamo in due sottocompiti: formulare affermazioni diagnostiche e suggerire modifiche. Presentiamo ActReview, un framework di post-addestramento guidato dalle repliche degli autori che collega le diagnosi relative a ciascun articolo a piani di modifica concreti e fondati su evidenze. L’intuizione centrale è che le repliche degli autori rivelano interventi plausibili per rispondere alle osservazioni dei revisori e possono quindi fornire una supervisione implicita per riscontri orientati alla modifica degli articoli. A partire da scambi reali tra revisori e autori su OpenReview, costruiamo ActReview-40K associando i punti deboli individuati dai revisori alle risposte degli autori e ancorando i riscontri così ottenuti a evidenze localizzate negli articoli. Sottoponiamo Qwen3-8B-Base a un post-addestramento con fine-tuning supervisionato multi-task, seguito da GRPO con ricompense basate su rubriche specifiche per ciascun punto debole e che tengono conto dei candidati. Presentiamo inoltre ActReview-Bench, un benchmark di 1.000 casi curato da esseri umani per valutare la qualità delle diagnosi e l’utilità dei suggerimenti di modifica. Gli esperimenti mostrano che ActReview supera i precedenti modelli specializzati nella generazione di valutazioni per quanto riguarda la possibilità di tradurre i riscontri in interventi concreti e il loro ancoraggio alle evidenze, pur restando competitivo con LLM efficaci basati su prompt. La valutazione umana conferma la maggiore utilità dei suggerimenti di modifica, ma evidenzia un divario ancora presente nell’accuratezza tecnica; ulteriori analisi indicano una capacità di generalizzazione agli articoli tenuti da parte e una robustezza rispetto a valutatori indipendenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv