Vai al contenuto
AI.info

The Pulse

I ricercatori di UCR separano la sicurezza dei modelli linguistici di grandi dimensioni dalla correttezza

I ricercatori della UC Riverside hanno individuato caratteristiche interne distinte associate alla sicurezza e alla correttezza dei modelli linguistici e hanno verificato come la modifica di tali caratteristiche influisse sulle risposte.

I ricercatori di UCR separano la sicurezza dei modelli linguistici di grandi dimensioni dalla correttezza

AI.info Team ·

«Un modello può rispondere con sicurezza e sbagliare, oppure può rispondere con meno sicurezza ed essere corretto.»

Het Patel, dottorando in informatica alla UCR e autore principale, citato da UC Riverside News

La sicurezza non garantisce una risposta corretta

Il 23 settembre la UC Riverside ha reso nota la ricerca, descrivendo uno studio secondo cui la sicurezza e la correttezza dei modelli linguistici di grandi dimensioni possono essere associate a caratteristiche interne distinte. I ricercatori hanno esaminato Llama-3.1-8B di Meta e Gemma-2-9B di Google, usando autoencoder sparsi per individuare schemi nell’attività interna di ciascun modello.

Il paper, inviato ad arXiv il 21 aprile, suddivide le risposte dei modelli in quattro gruppi: sicure e corrette, sicure e scorrette, incerte e corrette, incerte e scorrette. Questo schema permette al gruppo di esaminare separatamente i segnali associati alla sicurezza e quelli associati alla correttezza delle risposte, invece di trattare l’incertezza espressa da un modello come un indicatore affidabile del fatto che conosca o meno la risposta.

Tre tipi di caratteristiche hanno avuto comportamenti diversi

L’analisi ha individuato caratteristiche associate principalmente all’incertezza, caratteristiche associate principalmente alle risposte scorrette e un terzo gruppo legato a entrambe. I ricercatori hanno poi soppresso alcune caratteristiche mentre i modelli, già addestrati, rispondevano alle domande. Ridurre l’attivazione delle sole caratteristiche legate all’incertezza ha danneggiato nettamente l’accuratezza, mentre sopprimere la maggior parte di quelle legate soltanto alle risposte scorrette ha avuto scarso effetto.

Sopprimere le caratteristiche sovrapposte, o «confondenti», ha prodotto un risultato diverso: l’accuratezza è migliorata fino all’1,1% e l’entropia dell’output è diminuita fino al 75%. Gli autori riferiscono che gli effetti si sono trasferiti ai benchmark di domande e risposte ARC-Challenge e RACE. L’intervento avviene durante l’inferenza, mentre il modello genera le risposte; non richiede un nuovo addestramento del modello.

Tre caratteristiche di Llama hanno aiutato a individuare quando astenersi

In una prova separata, le attivazioni di tre caratteristiche confondenti in uno strato intermedio di Llama-3.1-8B hanno aiutato a prevedere se una risposta sarebbe stata scorretta. Quando il modello si è astenuto dalle domande segnalate da quel indicatore, la sua accuratezza sulle domande a cui ha risposto è salita dal 62% all’81%, con una copertura del 53%. Nel confronto dei ricercatori, lasciare che fosse il modello a decidere quando dire «Non lo so» ha portato l’accuratezza soltanto a circa il 64%.

Questi risultati descrivono un compromesso: l’accuratezza più elevata è stata ottenuta rispondendo soltanto a circa metà delle domande. Il segnale delle caratteristiche può quindi aiutare a individuare le risposte rischiose, ma non rende il modello uniformemente più affidabile con ogni prompt.

I risultati indicano un intervento mirato, non una soluzione generale

I risultati offrono un modo per analizzare e modificare specifici schemi interni senza cambiare i pesi del modello con un nuovo ciclo di addestramento. Gli esperimenti, però, riguardano due modelli open-weight e benchmark di domande e risposte; il paper non dimostra che le stesse caratteristiche o gli stessi miglioramenti si ritroveranno in altri modelli o in compiti del mondo reale.

Secondo la UCR, lo studio, «Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders», è stato accettato per la presentazione alla SIAM International Conference on Data Mining, che si terrà a Salt Lake City a novembre. Il risultato centrale è più circoscritto di una soluzione generale agli errori commessi con sicurezza: alcuni segnali interni seguono l’incertezza, altri gli errori, e la manipolazione dei segnali legati a entrambe ha modificato le risposte dei modelli testati.

Fonte

Esplora

Altri articoli