Vai al contenuto
AI.info

Ricerca

L’ottimalità per singola matrice non basta: ottimizzazione a tre livelli per la compressione a basso rango degli LLM

Il troncamento della decomposizione ai valori singolari (SVD) per singola matrice è ottimale secondo Eckart-Young nella norma di Frobenius sbiancata, ma gli errori delle matrici compresse indipendente

L’ottimalità per singola matrice non basta: ottimizzazione a tre livelli per la compressione a basso rango degli LLM
arXiv
2609.15838
Pubblicato
2026-09-14
Autori
Huicheng Zhang, Xiyao Feng, Ze-Tong Li, Chengkai Zhu, Xiao Shi, Xiwei Pan, Jinguo Liu, Ge Bai, Xin Wang

Abstract degli autori

Il troncamento della decomposizione ai valori singolari (SVD) per singola matrice è ottimale secondo Eckart-Young nella norma di Frobenius sbiancata, ma gli errori delle matrici compresse indipendentemente si sommano nel passaggio in avanti non lineare del blocco. Ispirandoci in parte all’ottimizzazione variazionale gerarchica dei metodi quantistici per i sistemi a molti corpi, introduciamo una catena a tre livelli che amplia progressivamente l’ambito dell’ottimizzazione: dalle singole matrici ai blocchi Transformer fino all’intero modello. La catena comprende SVD sbiancata~(L1), ottimizzazione congiunta a livello di blocco~(L2) e affinamento della funzione di perdita di modellazione linguistica end-to-end~(L3), il tutto con 256 sequenze di calibrazione e senza dati di istruzioni o di recupero. Con LLaMA-7B e una compressione del 60%, la catena riduce la perplexity su WikiText-2 da 42,1 a 19,1 e poi a 11,4. La fase a livello di blocco agisce da regolarizzatore: saltarla peggiora di 24 punti la perplexity su Penn Treebank (PTB), un divario che, nei nostri esperimenti, ulteriore addestramento end-to-end non ha colmato. I miglioramenti della perplexity si mantengono con livelli di compressione dal 20 all’80%, su cinque architetture fino a 13B di parametri e nei benchmark sia in distribuzione sia fuori distribuzione; tuttavia, i risultati sulle diverse architetture usano configurazioni specifiche per ciascuna architettura e la scansione del rapporto di compressione non è stata eseguita secondo un unico protocollo comune. Con più dati di calibrazione, saltare la fase a livello di blocco diventa competitivo, mettendo in luce un compromesso tra calcolo e dati in modalità offline. Rivendichiamo quindi miglioramenti soltanto in termini di perplexity e fedeltà della compressione; l’accuratezza nelle attività a valle resta nettamente inferiore a quella del modello denso.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv