Vai al contenuto
AI.info

Ricerca

L’attenzione a finestra scorrevole supera l’attenzione lineare

A causa della natura quadratica dell’attenzione, i modelli linguistici di grandi dimensioni (LLM) consumano molta memoria ed energia. Ogni nuovo token costa più del precedente. Per ogni token aggiunti

L’attenzione a finestra scorrevole supera l’attenzione lineare
arXiv
2608.28444
Pubblicato
2026-08-28
Autori
Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais

Abstract degli autori

A causa della natura quadratica dell’attenzione, i modelli linguistici di grandi dimensioni (LLM) consumano molta memoria ed energia. Ogni nuovo token costa più del precedente. Per ogni token aggiuntivo, le chiavi e i valori devono essere conservati in memoria a tempo indeterminato, il che è insostenibile. Per risolvere il problema della crescita quadratica dei costi sono state proposte diverse alternative, tra cui adattare gli LLM all’uso dell’attenzione lineare. Questa idea ha suscitato molto interesse perché promette di risolvere il problema mantenendo prestazioni allo stato dell’arte a basso costo. Tuttavia, questo filone di ricerca non è stato confrontato adeguatamente con soluzioni di riferimento più semplici. In questo lavoro mostriamo che l’attenzione a finestra scorrevole (SWA) con sink ottiene risultati pari o superiori a quelli dei modelli ad attenzione lineare sottoposti a post-addestramento. Lo osserviamo in diversi LLM e in varie attività a valle. Nelle attività di ragionamento su contesti lunghi (Needle-in-a-Haystack e BABILong), SWA raggiunge prestazioni nettamente superiori: da 2 a 10 volte quelle dell’attenzione lineare. SWA non richiede post-addestramento, è estremamente veloce e richiede poca memoria: è quindi una soluzione estremamente economica e affidabile. Per ridurre il consumo di memoria durante l’inferenza, raccomandiamo vivamente di passare a SWA anziché sottoporre i modelli lineari a post-addestramento. I modelli ad attenzione lineare potrebbero aver mostrato un certo potenziale, ma probabilmente richiedono un addestramento da zero o un ampio post-addestramento anche solo per eguagliare SWA.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv