Ricerca
Quando le revisioni dell’IA addestrano i revisori IA: collasso del giudizio scientifico e mitigazione
I modelli linguistici di grandi dimensioni (LLM) partecipano sempre più spesso alla valutazione scientifica, sia come revisori automatici sia come assistenti dei revisori umani. Quando le revisioni ge

- arXiv
- 2609.20942
- Pubblicato
- 2026-09-21
- Autori
- Sy-Tuyen Ho, Minghui Liu, Furong Huang
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) partecipano sempre più spesso alla valutazione scientifica, sia come revisori automatici sia come assistenti dei revisori umani. Quando le revisioni generate dai modelli entrano a far parte dei dati pubblici e dei futuri corpora di addestramento, la revisione paritaria con IA può diventare ricorsiva: i revisori successivi imparano dai giudizi formulati dai modelli precedenti. Studiamo una fase di questo ciclo di retroazione in un contesto controllato. Partendo da Llama 3.1 8B, sottoponiamo prima a fine-tuning un revisore sulle revisioni ufficiali di ICLR dal 2018--2023, quindi addestriamo quattro modelli successivi sui dati di ICLR 2024, variando sistematicamente le proporzioni di revisioni ufficiali e generate dai modelli. Il nostro studio mostra che l’introduzione di revisioni sintetiche restringe la distribuzione dei punteggi e riduce la diversità semantica sia all’interno delle revisioni dello stesso articolo sia a livello di corpus. Definiamo questo fenomeno $\textbf{scientific-judgment collapse}$. Per mitigare questo problema, presentiamo $\textbf{TrustReviewer}$, un sistema open source basato su LLM per generare revisioni paritarie di articoli sull’IA e sul machine learning. TrustReviewer interviene in due fasi complementari. Per prevenire il problema durante l’addestramento, addestriamo il revisore di base in un’unica fase su un corpus selezionato, progettato per ridurre la supervisione di bassa qualità e semanticamente degenerata. Per correggere il problema al momento del test, lo steering appaiato delle attivazioni mira a mitigare ulteriormente le tendenze residue verso giudizi appiattiti, senza ulteriore addestramento né annotazioni aggiuntive da parte di esperti. Nel loro insieme, questi risultati descrivono un rischio concreto dell’addestramento ricorsivo dei revisori e propongono interventi pratici per preservare la diversità dei giudizi e migliorare l’allineamento delle raccomandazioni nella valutazione scientifica assistita dall’IA.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv