Vai al contenuto
AI.info

Ricerca

Un test della macchina della verità per i modelli linguistici: leggere le conoscenze che un modello non rivela

I grandi modelli linguistici possono possedere conoscenze che non dichiarano. Un modello può simulare intenzionalmente prestazioni inferiori durante una valutazione delle sue capacità, oppure dare una

Un test della macchina della verità per i modelli linguistici: leggere le conoscenze che un modello non rivela
arXiv
2609.21996
Pubblicato
2026-09-18
Autori
Hiskias Dingeto

Abstract degli autori

I grandi modelli linguistici possono possedere conoscenze che non dichiarano. Un modello può simulare intenzionalmente prestazioni inferiori durante una valutazione delle sue capacità, oppure dare una risposta in contrasto con ciò che sa internamente. Le sue sole risposte non permettono di capire se stia nascondendo la risposta o se semplicemente non la conosca. Riprendiamo il Concealed Information Test, un metodo forense che individua conoscenze incriminanti presentando a un sospettato il dettaglio vero fra alternative plausibili e misurando una reazione più forte all’elemento che riconosce. Il nostro metodo, Probe of Internal Recognition (PIR), fa lo stesso all’interno di un modello. Presenta una domanda con le possibili risposte e legge negli stati interni del modello quale risposta riconosce come corretta. PIR non richiede riferimenti: non ha bisogno né di un modello di riferimento che risponda onestamente né di un corpus di risposte corrette etichettate. Su otto modelli di cinque famiglie (Gemma, Qwen, Llama, Mistral e Phi), PIR recupera la risposta riconosciuta con un’accuratezza bilanciata compresa tra 0,70 e 0,87, ben al di sopra del livello di riferimento di 0,28–0,40 per gli elementi sconosciuti e del valore di 0,25 atteso per caso. Il segnale resta leggibile in tutte le forme di occultamento che abbiamo testato, dall’inganno indotto da un prompt e dalla simulazione intenzionale di prestazioni inferiori ottenuta tramite addestramento fino a checkpoint esterni bloccati da password o sottoposti a circuit breaking, con valori di riconoscimento compresi tra 0,85 e 0,93. Quando il modello nasconde una risposta che conosce, il riconoscimento resta elevato. Quando l’unlearning elimina quella conoscenza, il riconoscimento scende al livello di una domanda di cui il modello non ha mai conosciuto la risposta. PIR distingue quindi un modello che non risponde da uno che non può farlo, a sostegno degli audit sulla simulazione intenzionale di prestazioni inferiori e della verifica dell’unlearning. Il segnale è causale, fornisce informazioni aggiuntive rispetto agli indizi comportamentali osservabili dall’esterno e si estende dalle domande a scelta multipla alla generazione di risposte in forma libera.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv