Ricerca
Punti deboli periodici: sensibilità alla fase dovuta alla compressione della cache KV a blocchi
La compressione della cache KV a blocchi riduce i costi di memoria e di attenzione nell’inferenza su contesti lunghi comprimendo finestre di token consecutivi in un numero minore di voci della cache,

- arXiv
- 2609.36322
- Pubblicato
- 2026-09-28
- Autori
- Xingyu Zhu, Pu, Yi, Ziheng Cheng, Ang Lv, Jing Liu, Lexing Ying, Yiyuan Ma, Xin Dong
Abstract degli autori
La compressione della cache KV a blocchi riduce i costi di memoria e di attenzione nell’inferenza su contesti lunghi comprimendo finestre di token consecutivi in un numero minore di voci della cache, a intervalli fissi. Questa compressione introduce anche una nuova coordinata posizionale: la fase di un token, ovvero la sua posizione rispetto ai confini delle finestre di compressione. Individuiamo un’asimmetria sistematica nei modelli che usano questa compressione: la stessa informazione può essere facile da recuperare in una fase e difficile in un’altra. Chiamiamo questa variazione periodica delle prestazioni di recupero «sensibilità alla fase». Nei grandi modelli a pesi aperti che usano questa compressione, l’accuratezza del recupero su contesti lunghi può variare fino a 40 punti percentuali tra le diverse fasi, rivelando punti deboli periodici che i punteggi medi dei benchmark possono nascondere. Per studiare questo comportamento, pre-addestriamo da zero una famiglia di transformer con diversi schemi di compressione della cache KV, riproducendo la sensibilità alla fase nelle varie configurazioni. Un’analisi dei meccanismi, condotta mediante interventi causali su questi modelli, rivela una specializzazione per fase: componenti diverse del meccanismo di attenzione contribuiscono in modo asimmetrico al recupero delle informazioni a seconda della fase in cui si trovano nella sorgente. Analizziamo inoltre modelli di recupero idealizzati, mostrando come le dinamiche del flusso del gradiente possano favorire una marcata specializzazione per fase. Valutare i modelli con compressione della cache KV a blocchi richiede quindi misurazioni nelle diverse fasi di compressione: un’accuratezza media elevata può coesistere con errori posizionali sistematici.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv