Vai al contenuto
AI.info

Ricerca

Rilevare i bias nei LLM tramite rappresentazioni relative degli stati nascosti basate su riferimenti

I metodi esistenti per verificare i bias si basano in genere sugli output dei modelli: richiedono benchmark costosi o modelli giudice e possono non rilevare cambiamenti interni che non emergono mai ne

Rilevare i bias nei LLM tramite rappresentazioni relative degli stati nascosti basate su riferimenti
arXiv
2609.10060
Pubblicato
2026-09-09
Autori
Marek Jeliński, Jan Dubiński, Maciej Chrabaszcz, Sebastian Cygert

Abstract degli autori

I metodi esistenti per verificare i bias si basano in genere sugli output dei modelli: richiedono benchmark costosi o modelli giudice e possono non rilevare cambiamenti interni che non emergono mai nel testo generato. Proponiamo un metodo basato su riferimenti che verifica i bias nelle rappresentazioni degli stati nascosti di varianti correlate di un modello, per esempio prima e dopo il fine-tuning. Poiché il fine-tuning modifica la geometria delle rappresentazioni, gli stati nascosti assoluti non sono direttamente confrontabili. Rappresentiamo quindi ogni frase attraverso le sue somiglianze con un insieme fisso di frasi di riferimento, ottenendo rappresentazioni relative in uno spazio di confronto condiviso. In questo spazio misuriamo come cambia l’associazione dei gruppi bersaglio con attributi positivi e negativi: chiamiamo questa misura Representational Bias Shift $ΔB$. Su tre famiglie di modelli e sui benchmark WildGuardMix, DecodingTrust e ToxiGen, $ΔB$ è correlato alla variazione dei bias negli output in 15 delle 18 configurazioni esaminate, raggiungendo $|r| = 0.84$ ($p < 0.001$) con il fine-tuning completo; con l’adattamento efficiente in termini di parametri, la correlazione dipende maggiormente dal modello. Applicando una soglia a $ΔB$, si individuano i checkpoint in cui il bias è aumentato, con un’area sotto la curva ROC compresa tra $0.65$ e $0.99$. Su WildGuardMix e DecodingTrust, per tutte e tre le famiglie, il metodo li distingue meglio di una baseline basata su SEAT. $ΔB$ rimane inoltre stabile al variare dell’insieme delle frasi di riferimento, degli insiemi di attributi e dei template dei gruppi bersaglio. Il nostro metodo non richiede dati di valutazione specifici per il compito e consente di verificare un modello in circa tre minuti, usando $3$-$50\times$ meno risorse computazionali rispetto ai benchmark basati sugli output considerati qui. Lo consideriamo complementare alla verifica basata sugli output, non un suo sostituto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv