Ricerca
Capacità di recupero della self-attention in condizioni di competizione
Quanti token del contesto usa effettivamente un modello linguistico, e da cosa dipende questo numero? Studiamo la questione attraverso la self-attention. Senza riaddestrare il modello, conserviamo sol

- arXiv
- 2609.37879
- Pubblicato
- 2026-09-29
- Autori
- Timur Mudarisov, Mikhail Burtsev, Radu State
Abstract degli autori
Quanti token del contesto usa effettivamente un modello linguistico, e da cosa dipende questo numero? Studiamo la questione attraverso la self-attention. Senza riaddestrare il modello, conserviamo soltanto i token con i pesi di attenzione più alti per ogni testa, livello e query, lasciando invariati i loro pesi originali. Variando la numerosità dell’insieme selezionato e misurando l’aumento della log-verosimiglianza negativa (NLL), stimiamo la numerosità effettiva dell’insieme di attenzione necessaria per restare entro una soglia di tolleranza scelta per la perdita. Insiemi selezionati relativamente piccoli possono mantenere la NLL vicina al valore di riferimento ottenuto con l’attenzione completa, anche se la numerosità necessaria varia da un modello all’altro. La selezione basata sull’attenzione supera nettamente quella casuale. Gli insiemi selezionati presentano una struttura geometrica, anche se la sola separazione geometrica non dimostra che la perdita del modello resti invariata. Estendere il contesto valutando gli stessi obiettivi di predizione fa aumentare la numerosità necessaria dell’insieme, mentre la sua quota rispetto al contesto diminuisce nell’intervallo esaminato. Esperimenti con un fatto di supporto mantenuto fisso mostrano che l’aggiunta di informazioni di contesto fa scendere i suoi token nella classifica dell’attenzione e riduce la massa di attenzione loro assegnata. Rinormalizzare i pesi conservati può ridurre notevolmente la numerosità necessaria dell’insieme, mostrando che questa dipende anche da come vengono combinate le rappresentazioni selezionate. Modelli teorici condizionali spiegano come la competizione e la conservazione della massa di attenzione possano far crescere la numerosità degli insiemi senza che aumentino le informazioni distinte da recuperare. Questi risultati offrono un modo per misurare la numerosità effettiva dell’insieme di attenzione nei modelli linguistici e studiare come dipenda dal contesto, dalla competizione e dall’aggregazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv