Ricerca
GeoPair: fattorizzazione interstrato che preserva la geometria per la compressione dei transformer senza addestramento
Le architetture transformer presentano ridondanze tra gli strati, ma le pipeline di compressione post-addestramento in genere ottimizzano gli strati singolarmente oppure si affidano a strategie eurist

- arXiv
- 2609.25963
- Pubblicato
- 2026-09-22
- Autori
- Baher Mohammad, Ammar Ali, Stamatios Lefkimmiatis
Abstract degli autori
Le architetture transformer presentano ridondanze tra gli strati, ma le pipeline di compressione post-addestramento in genere ottimizzano gli strati singolarmente oppure si affidano a strategie euristiche di raggruppamento che ignorano le geometrie delle attivazioni specifiche di ciascuno strato. Introduciamo un framework rigoroso, senza addestramento, che ottimizza in sequenza gli abbinamenti dei pesi tra strati e le fattorizzazioni con dizionario condiviso. Anziché imporre ai pesi di strati adiacenti di condividere una base o unire euristicamente le statistiche delle attivazioni, il nostro approccio individua proiezioni strutturalmente compatibili e apprende una rappresentazione condivisa che preserva meglio la distinta geometria di calibrazione di ciascuno strato. In combinazione con la sparsità strutturata, questo consente decomposizioni dei pesi altamente efficienti senza sacrificare la fedeltà funzionale. Su architetture, scale e modalità diverse, il nostro metodo raggiunge risultati allo stato dell’arte, superando sistematicamente le decomposizioni strutturate indipendenti dei pesi e le fattorizzazioni alternative a coppie dei pesi, che si basano su strategie euristiche di raggruppamento. Sostituendo le strategie euristiche di progettazione con una pipeline convergente, guidata dall’ottimizzazione, poniamo le basi teoriche per una compressione dei transformer scalabile e applicabile a diverse modalità.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv