The Pulse
Una nuova sonda rileva le conoscenze che gli LLM si rifiutano di rivelare
Un preprint di Hiskias Dingeto presenta la Probe of Internal Recognition, un metodo per distinguere le conoscenze che un modello linguistico nasconde dalle informazioni che non ha mai posseduto.

AI.info Team ·
Una sonda per le conoscenze celate dietro una risposta sbagliata
Il 18 settembre 2026, Hiskias Dingeto ha presentato un articolo su arXiv, descrivendo un metodo pensato per affrontare una domanda circoscritta ma dalle conseguenze rilevanti: quando un modello linguistico dà una risposta sbagliata, è perché gli mancano le conoscenze necessarie o perché le nasconde?
L’articolo presenta la Probe of Internal Recognition, o PIR. Invece di giudicare un modello solo da ciò che dice, la PIR ne esamina gli stati interni mentre prende in considerazione una domanda e una serie di possibili risposte. Il metodo cerca di individuare quale risposta il modello riconosce come corretta, anche quando la sua risposta non rivela tale riconoscimento.
L’approccio di Dingeto adatta il Concealed Information Test, un metodo forense che presenta a un sospettato un dettaglio vero insieme a opzioni fuorvianti ma plausibili e misura una risposta più intensa all’elemento che il sospettato riconosce. La PIR applica un contrasto simile all’interno di un modello linguistico, usando i suoi stati interni per determinare quale risposta riconosce. Il metodo non richiede un modello di riferimento onesto né un corpus etichettato che identifichi le risposte corrette.
«La PIR non richiede un modello di riferimento onesto né un corpus di verità etichettato.»
Hiskias Dingeto, autore del preprint su arXiv
Verificare se i modelli nascondono risposte che conoscono
L’abstract riporta test su otto modelli appartenenti a cinque famiglie: Gemma, Qwen, Llama, Mistral e Phi. Su questi modelli, la PIR recupera la risposta riconosciuta dal modello con un’accuratezza bilanciata compresa tra 0,70 e 0,87. La baseline riportata per gli elementi sconosciuti va da 0,28 a 0,40, a fronte di un valore casuale di 0,25.
Il metodo continua a funzionare in diverse forme di occultamento descritte nell’articolo. Tra queste figurano l’inganno indotto tramite prompt, il sandbagging ottenuto con l’addestramento e checkpoint esterni bloccati da password o con circuiti interrotti. In questi test di occultamento, il riconoscimento varia da 0,85 a 0,93, secondo l’abstract. Il risultato riportato è che, quando un modello nasconde una risposta che conosce, il segnale di riconoscimento interno rimane elevato.
Questa distinzione è centrale per l’uso della PIR proposto nell’articolo. Un modello può non fornire una risposta perché non possiede le conoscenze pertinenti, oppure può rifiutarsi di rispondere pur riconoscendola internamente. La PIR intende distinguere i due casi leggendo la risposta interna del modello, anziché basarsi soltanto sul testo che produce.
Unlearning e audit dei modelli
Dingeto riporta anche un andamento diverso quando l’unlearning rimuove delle conoscenze. In questi test, il riconoscimento scende al livello associato a una domanda di cui il modello non era mai stato a conoscenza. L’abstract presenta questo risultato come prova del fatto che la PIR può distinguere un modello che non vuole rispondere da uno che non è in grado di farlo.
L’articolo propone applicazioni negli audit del sandbagging e nella verifica dell’unlearning. In un audit del sandbagging, il metodo potrebbe essere usato per verificare se un modello nasconde una capacità durante una valutazione. In una valutazione dell’unlearning, potrebbe fornire un segnale interno per stabilire se un’informazione è stata rimossa, anziché semplicemente nascosta nell’output del modello.
L’abstract afferma inoltre che il segnale è causale e aggiunge informazioni che vanno oltre gli indizi comportamentali ottenuti con metodi black-box. La PIR non è limitata alle domande a scelta multipla: Dingeto riferisce che il metodo si estende anche alla generazione libera.
Il lavoro è un preprint su arXiv con un solo autore. Le sue affermazioni descrivono un metodo di ricerca per esaminare le rappresentazioni dei modelli, non una garanzia generale che sia possibile recuperare ogni capacità nascosta. L’abstract presenta la PIR come uno strumento per indagare se un modello riconosce internamente una risposta quando la sua risposta esterna afferma il contrario.