Vai al contenuto
AI.info

Ricerca

GeoPair: fattorizzazione interstrato che preserva la geometria per la compressione dei transformer senza addestramento

Le architetture transformer presentano ridondanze tra gli strati, ma le pipeline di compressione post-addestramento in genere ottimizzano gli strati singolarmente oppure si affidano a strategie eurist

GeoPair: fattorizzazione interstrato che preserva la geometria per la compressione dei transformer senza addestramento
arXiv
2609.25963
Pubblicato
2026-09-22
Autori
Baher Mohammad, Ammar Ali, Stamatios Lefkimmiatis

Abstract degli autori

Le architetture transformer presentano ridondanze tra gli strati, ma le pipeline di compressione post-addestramento in genere ottimizzano gli strati singolarmente oppure si affidano a strategie euristiche di raggruppamento che ignorano le geometrie delle attivazioni specifiche di ciascuno strato. Introduciamo un framework rigoroso, senza addestramento, che ottimizza in sequenza gli abbinamenti dei pesi tra strati e le fattorizzazioni con dizionario condiviso. Anziché imporre ai pesi di strati adiacenti di condividere una base o unire euristicamente le statistiche delle attivazioni, il nostro approccio individua proiezioni strutturalmente compatibili e apprende una rappresentazione condivisa che preserva meglio la distinta geometria di calibrazione di ciascuno strato. In combinazione con la sparsità strutturata, questo consente decomposizioni dei pesi altamente efficienti senza sacrificare la fedeltà funzionale. Su architetture, scale e modalità diverse, il nostro metodo raggiunge risultati allo stato dell’arte, superando sistematicamente le decomposizioni strutturate indipendenti dei pesi e le fattorizzazioni alternative a coppie dei pesi, che si basano su strategie euristiche di raggruppamento. Sostituendo le strategie euristiche di progettazione con una pipeline convergente, guidata dall’ottimizzazione, poniamo le basi teoriche per una compressione dei transformer scalabile e applicabile a diverse modalità.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv