Vai al contenuto
AI.info

Ricerca

Sparse Readout Prism: spiegare i punteggi della logit lens attraverso le feature anziché i token

La previsione del token successivo da parte di un modello linguistico si sviluppa attraverso i vari livelli, e i metodi lens seguono questo processo decodificando gli stati nascosti intermedi in token

Sparse Readout Prism: spiegare i punteggi della logit lens attraverso le feature anziché i token
arXiv
2609.01936
Pubblicato
2026-09-01
Autori
Matteo He, William F. Shen, Xinchi Qiu, Nicholas D. Lane

Abstract degli autori

La previsione del token successivo da parte di un modello linguistico si sviluppa attraverso i vari livelli, e i metodi lens seguono questo processo decodificando gli stati nascosti intermedi in token. Ma la lettura fornita da una lens dipende sia dallo stato nascosto sia dal readout (la matrice di unembedding) usato per decodificarlo. Molte lens vengono adattate su un corpus, e mostriamo che due lens che differiscono solo per il corpus usato nell’adattamento possono indicare token diversi per gli stessi stati nascosti. Chiamiamo questa dipendenza «condizionalità rispetto al corpus». Per esaminare la struttura del readout indipendentemente dal corpus di adattamento, introduciamo Sparse Readout Prism (SRP), che scompone il readout usando soltanto i suoi pesi ed esprime qualsiasi logit di un token, o differenza tra logit, come somma dei contributi di feature sparse del readout. Questo rende le feature del readout una nuova unità di analisi per le letture delle lens, mettendo in luce una struttura che l’identità dei token può nascondere e consentendo confronti tra token, contesti, livelli e lens. La sostituzione del readout originale con l’approssimazione sparsa di SRP permette di ricostruire una quota delle differenze tra logit esaminate superiore di 8,9–17,3 punti percentuali rispetto alla migliore delle sei baseline basate sulle relazioni geometriche tra le righe del readout. L’ablazione delle feature modifica le differenze tra logit in proporzione ai contributi loro attribuiti da SRP. Sebbene le letture dei token varino a seconda del corpus di adattamento, la feature dominante del readout rimane stabile. Poiché SRP non usa alcun corpus per la propria costruzione, offre un termine di confronto indipendente dal corpus di adattamento per le analisi delle lens.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv