Vai al contenuto
AI.info

Ricerca

Riciclaggio del danno nei modelli GPT: prove che la discriminazione di genere viene trasformata anziché ridotta nelle generazioni addestrate per la sicurezza

Le valutazioni della sicurezza dei modelli linguistici di grandi dimensioni si affidano a classificatori basati sulla forma superficiale del testo, che segnalano una diminuzione dei punteggi di dannos

Riciclaggio del danno nei modelli GPT: prove che la discriminazione di genere viene trasformata anziché ridotta nelle generazioni addestrate per la sicurezza
arXiv
2609.20779
Pubblicato
2026-09-17
Autori
Sarah Wyer, Sue Black, Noura Al Moubayed

Abstract degli autori

Le valutazioni della sicurezza dei modelli linguistici di grandi dimensioni si affidano a classificatori basati sulla forma superficiale del testo, che segnalano una diminuzione dei punteggi di dannosità da una generazione di modelli all’altra. Presentiamo prove del fatto che questa metodologia è sistematicamente incompleta: i contenuti esplicitamente discriminatori vengono trasformati, non eliminati. Chiamiamo questo fenomeno \emph{harm laundering}. Analizzando 450.000 completamenti rivolti a un genere in 15 modelli, da GPT-2 a GPT-5 (la linea GPT di OpenAI; tre condizioni demografiche), mostriamo che i cluster relativi alla violenza sessuale, frequenti nei completamenti rivolti alle donne prodotti da GPT-2, scompaiono entro GPT-4, mentre i completamenti rivolti agli uomini acquisiscono uno spazio di rappresentazione positivo (attività di cura, gamma emotiva, identità di alleato) che quelli rivolti alle donne non acquisiscono. Il fenomeno è più evidente in GPT-5: Topic~5 (1.997~documenti) inquadra il tumore al seno come un dibattito sui diritti degli uomini, mentre nei completamenti rivolti alle donne non compare alcun cluster equivalente. Tre classificatori indipendenti valutano questi contenuti come non tossici. I punteggi di sentiment si invertono con GPT-4: i primi modelli sminuiscono le donne; quelli successivi correggono in eccesso. La diversità dei temi nei completamenti rivolti alle donne diminuisce del 36\% rispetto a quelli rivolti agli uomini al passaggio all’allineamento di GPT-4 (W/M~$= 0.58$, rispetto a $0.91$ in GPT-2). La disparità del danno rappresentazionale rilevata da REGARD è correlata alla data di rilascio ($ρ= +0.55$, $p = .034$), mentre i punteggi di Detoxify non lo sono ($ρ= -0.23$, $p = .42$): i punteggi di tossicità diminuiscono mentre il danno rappresentazionale aumenta. Formalizziamo il riciclaggio del danno come un test basato su tre criteri e forniamo un protocollo di rilevamento in tre fasi applicabile a qualsiasi modello generativo. Nella linea GPT di OpenAI, la riduzione dei punteggi di tossicità non è un indicatore indiretto sufficiente della riduzione del danno.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv