Ricerca
Selezionare i token più informativi negli autoencoder del linguaggio naturale
Gli autoencoder del linguaggio naturale traducono le attivazioni interne di un modello linguistico in spiegazioni leggibili. Spiegare ogni posizione dei token è costoso. Quali posizioni dovrebbe esami

- arXiv
- 2609.37040
- Pubblicato
- 2026-09-29
- Autori
- Federico Torrielli, Gianluca Barmina, Andrea Blasi Núñez, Amon Rapp, Luigi Di Caro, Peter Schneider-Kamp, Lukas Galke Poech
Abstract degli autori
Gli autoencoder del linguaggio naturale traducono le attivazioni interne di un modello linguistico in spiegazioni leggibili. Spiegare ogni posizione dei token è costoso. Quali posizioni dovrebbe esaminare chi conduce un audit per comprendere una potenziale minaccia? Studiamo questa domanda su $4.7$ milioni di spiegazioni relative alla prompt injection e all’occultamento. Confrontiamo i segnali ricavati dai calcoli del modello con un ranker addestrato soltanto sulla struttura della chat. Di solito, la struttura della chat permette di selezionare spiegazioni più pertinenti rispetto ai segnali computazionali, senza richiedere un forward pass del modello per scegliere le posizioni. In tre dei quattro dataset, spiegare appena il $5\%$ delle posizioni conserva quasi tutto il tasso di successo ottenuto spiegando ogni posizione, dove per successo si intende ottenere una spiegazione relativa alla minaccia. Il vantaggio varia a seconda del compito di audit. Mostriamo inoltre che i verbalizzatori preaddestrati recuperano parole che i modelli hanno imparato a nascondere attraverso il fine-tuning, senza ulteriore addestramento dei verbalizzatori. Questi risultati indicano dove chi conduce un audit può concentrare la generazione delle spiegazioni e mostrano che le spiegazioni utili possono estendersi oltre il modello che un verbalizzatore è stato addestrato a descrivere.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv