The Pulse
Un passaggio di addestramento dell’IA ha ridotto dell’11% la diversità delle revisioni
Uno studio dell’University of Maryland rileva che aggiungere revisioni sintetiche all’addestramento dell’IA comprime le valutazioni e riduce la diversità semantica. I ricercatori presentano TrustReviewer, un sistema open source progettato p

AI.info Team ·
Secondo uno studio dell’University of Maryland pubblicato su arXiv il 17 settembre 2026, introdurre revisioni sintetiche nell’addestramento di un revisore scientifico basato sull’IA ha ridotto di circa l’11% la diversità semantica delle revisioni sullo stesso articolo dopo un solo passaggio di addestramento ricorsivo. I ricercatori hanno inoltre misurato una contrazione di circa il 5% dell’ampiezza semantica complessiva del corpus di revisioni.
L’articolo, «Quando le revisioni dell’IA addestrano i revisori dell’IA: collasso del giudizio scientifico e mitigazione», esamina un ciclo di retroazione che potrebbe formarsi quando le revisioni scritte da modelli diventano pubbliche, entrano nei successivi dataset di addestramento e influenzano i giudizi dei sistemi che ne derivano. Sy-Tuyen Ho, Minghui Liu e Furong Huang definiscono questo schema «collasso del giudizio scientifico».
Gli autori sottolineano che il loro esperimento non dimostra che i sistemi di IA dominino già la revisione paritaria scientifica. Isola invece gli effetti dell’aggiunta di una quantità nota di supervisione generata da un modello a un processo di addestramento altrimenti controllato.
Quattro combinazioni di addestramento, un unico schema di restringimento
L’esperimento parte dal modello Llama 3.1 8B Instruct di Meta. I ricercatori lo sottopongono a fine-tuning sulle revisioni ufficiali di ICLR dal 2018 al 2023, poi usano quel revisore per generare revisioni sintetiche per gli articoli di ICLR 2024.
Quattro modelli successivi ricevono diverse combinazioni di revisioni ufficiali e generate. Ogni articolo contribuisce ai dati di addestramento con tre revisioni: zero, una, due o tre sintetiche, corrispondenti a livelli di esposizione alle revisioni sintetiche dello 0%, 33%, 66% e 100%.
I modelli condividono la stessa inizializzazione, lo stesso processo di filtraggio e le stesse impostazioni di addestramento. La differenza pianificata è la proporzione di revisioni generate esplicitamente dal modello precedente, così da consentire ai ricercatori di confrontare l’effetto dell’esposizione alle revisioni sintetiche dopo un passaggio ricorsivo.
Le valutazioni diventano più concentrate
Lo studio valuta i modelli su 2.000 articoli non inclusi nell’addestramento, tratti dalle submission a ICLR dal 2018 al 2025. I ricercatori estraggono da ogni revisione generata la raccomandazione complessiva, su una scala da 1 a 10, e misurano la media, la deviazione standard e l’entropia delle distribuzioni dei punteggi risultanti.
Quando le revisioni sintetiche entrano nella combinazione di addestramento, la distribuzione dei punteggi si restringe. La deviazione standard scende da 1,63 per il modello successivo addestrato soltanto sulle revisioni ufficiali a 1,44 quando le revisioni sintetiche costituiscono il 33% della combinazione; ai livelli di esposizione più elevati il valore resta inferiore a quello di partenza.
Le valutazioni medie non si muovono in un’unica direzione. Salgono da 5,30 con un’esposizione alle revisioni sintetiche dello 0% a 5,85 al 33%, poi scendono a 5,70 al 100%. Gli autori interpretano il risultato come una riduzione dell’ampiezza dei giudizi, non come uno spostamento costante verso raccomandazioni più severe o più generose.
Le revisioni dello stesso articolo si somigliano di più
I ricercatori confrontano anche il linguaggio di più revisioni relative alla stessa submission. Trasformano le revisioni in embedding semantici e calcolano la distanza media a coppie, usando una distanza minore come indicatore di maggiore somiglianza.
La distanza scende da circa 0,159 per il modello addestrato soltanto sulle revisioni ufficiali a 0,153, 0,147 e 0,142 man mano che l’esposizione alle revisioni sintetiche sale dal 33% al 66% e poi al 100%. Il passaggio dallo 0% al 100% corrisponde a una riduzione di circa l’11% della diversità semantica delle revisioni sullo stesso articolo.
Il corpus nel suo complesso mostra una contrazione simile, anche se più contenuta. L’ampiezza semantica rispetto al centroide del corpus diminuisce da circa 0,609 con un’esposizione alle revisioni sintetiche dello 0% a 0,579 al 100%, una riduzione di circa il 5%.
Queste misurazioni non dimostrano che le revisioni individuino meno problemi scientifici validi. L’articolo usa la distanza tra embedding come indicatore della diversità e gli autori affermano che il metodo non verifica direttamente l’accuratezza fattuale, la qualità delle critiche o la copertura sostanziale.
TrustReviewer evita il secondo ciclo di addestramento
Ho, Liu e Huang propongono TrustReviewer, un sistema open source per generare revisioni di articoli sull’intelligenza artificiale e l’apprendimento automatico. Il suo processo di addestramento utilizza una raccolta selezionata di 112.743 esempi di articoli e revisioni tratti da materiale ufficiale di ICLR pubblicato dal 2018 al 2025, per un totale di circa 1,9 miliardi di token.
Il processo di selezione elimina gli esempi malformati, duplicati, eccessivamente brevi, ripetitivi e troppo lunghi. Il modello viene poi addestrato in un’unica fase, anziché su revisioni prodotte da un revisore precedente.
Il sistema introduce un secondo intervento al momento della generazione. I ricercatori creano coppie di direzioni di attivazione confrontando le revisioni ufficiali con quelle generate dal modello per gli stessi articoli, poi aggiungono il vettore di orientamento risultante allo strato decoder finale del modello mentre scrive una revisione.
Sull’insieme di valutazione non incluso nell’addestramento, TrustReviewer coincide con almeno una valutazione ufficiale per il 75,40% degli articoli. OpenReviewer raggiunge il 73,10%, Qwen3.6-35B-A3B il 61,85% e il modello Llama 3.1 8B non modificato il 33,93%.
L’entropia dei punteggi di TrustReviewer è 2,18, contro 2,38 per il riferimento delle revisioni ufficiali. L’orientamento delle attivazioni porta la percentuale di corrispondenza esatta dal 73,85% al 75,40% rispetto allo stesso checkpoint senza orientamento, con un guadagno di 1,55 punti percentuali.
Un esperimento circoscritto con un avvertimento più ampio
I risultati dell’articolo riguardano un solo passaggio ricorsivo, una sola famiglia di modelli di base e un solo ambito scientifico. Gli autori non dimostrano che l’effetto si accumuli nel corso di più generazioni, si estenda ad altri campi o si manifesti con modelli di dimensioni diverse.
Avvertono inoltre che le revisioni ufficiali di ICLR non costituiscono una verità di riferimento. Possono contenere errori, disaccordi e forme non rilevate di assistenza dell’IA; per questo lo studio usa «ufficiali» anziché «umane» per descrivere i dati di riferimento.
Il rischio concreto individuato dall’esperimento è più circoscritto: se i giudizi generati diventano materiale di addestramento per i revisori successivi, il sistema seguente potrebbe esprimere una gamma più ristretta di valutazioni e ragionamenti meno diversificati. I risultati di TrustReviewer suggeriscono che filtrare il corpus di addestramento e applicare un intervento moderato al momento dell’inferenza può preservare una maggiore diversità, ma lo studio non dimostra che una maggiore diversità, da sola, produca decisioni scientifiche migliori.