Ricerca
Un tassello mancante per revisori di IA affidabili: dalla valutazione della robustezza retorica tramite benchmark alla revisione SciCore
I revisori di IA possono esprimere giudizi diversi su manoscritti che presentano gli stessi contenuti scientifici con formulazioni diverse, premiando potenzialmente l’ottimizzazione retorica anziché i

- arXiv
- 2609.39027
- Pubblicato
- 2026-09-30
- Autori
- Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou
Abstract degli autori
I revisori di IA possono esprimere giudizi diversi su manoscritti che presentano gli stessi contenuti scientifici con formulazioni diverse, premiando potenzialmente l’ottimizzazione retorica anziché il miglioramento scientifico. Definiamo la robustezza retorica come il requisito congiunto di stabilità rispetto a riformulazioni che preservano il contenuto e di capacità di distinguere tra articoli. Presentiamo RobustReview, un benchmark controllato basato su manoscritti integrali che comprende 1.260 versioni di manoscritti, e valutiamo 30 configurazioni di revisori. Il benchmark rivela una falsa robustezza, in cui una bassa sensibilità alle riformulazioni si accompagna a un appiattimento dei punteggi tra gli articoli, e mostra che l’allineamento con le valutazioni umane e la robustezza retorica producono classifiche diverse dei revisori. Inoltre, il protocollo di formulazione dei prompt incentrato sul contenuto che abbiamo valutato non migliora in modo costante la robustezza con i diversi backbone. Alla luce di questi risultati, presentiamo SciCore, un revisore a doppio ramo che calcola la media tra un giudizio sull’intero manoscritto e uno basato su un nucleo scientifico estratto e strutturato. Questo approccio combina la valutazione del manoscritto nel suo insieme con una lettura normalizzata rispetto al contenuto, pensata per ridurre la sensibilità alla retorica. Nel nostro confronto principale condotto con GPT-5.5, SciCore ottiene un profilo congiunto di stabilità e capacità discriminante tra i migliori dei revisori inclusi nel benchmark, mantenendo un allineamento competitivo con le valutazioni umane. Questi risultati individuano nella robustezza retorica un obiettivo di valutazione distinto e mostrano il potenziale della revisione basata sul nucleo scientifico per migliorarla.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv