Vai al contenuto
AI.info

Ricerca

PrismQuant: rotazioni ottimali nello spazio nullo per quantizzatori a gruppi

Valori anomali meno pronunciati nelle attivazioni non implicano necessariamente una migliore quantizzazione a pochi bit: conta il loro allineamento con il quantizzatore. Presentiamo PrismQuant, un fra

PrismQuant: rotazioni ottimali nello spazio nullo per quantizzatori a gruppi
arXiv
2609.32429
Pubblicato
2026-09-26
Autori
Yanlong Chen, Yining Chen, Song Zhang, Amirhossein Habibian, Yawei Li

Abstract degli autori

Valori anomali meno pronunciati nelle attivazioni non implicano necessariamente una migliore quantizzazione a pochi bit: conta il loro allineamento con il quantizzatore. Presentiamo PrismQuant, un framework di rotazione che tiene conto del quantizzatore e allinea il principale sottospazio degli autovettori delle attivazioni con il sottospazio delle componenti costanti per gruppo nella quantizzazione INT4 asimmetrica a gruppi. Gli offset affini rappresentano l’energia in questo sottospazio senza ampliare l’intervallo all’interno del gruppo. Formuliamo la progettazione della rotazione come un problema di massimizzazione della traccia di Ky Fan e ne ricaviamo una soluzione in forma chiusa, dimostrabilmente ottimale per questo obiettivo di allineamento. Le trasformazioni compatte di Householder e la loro rappresentazione compact-WY consentono di costruire le rotazioni senza gradienti e di applicarle in modo efficiente sia nei punti in cui possono essere incorporate sia in quelli in cui vengono eseguite online. Una legge predittiva dell’intervallo collega inoltre l’energia non allineata delle attivazioni e la dimensione del gruppo alla variazione rilevante per la quantizzazione. Gli esperimenti su Llama, Qwen e Mistral comprendono modelli densi fino a 70 miliardi di parametri e un modello mixture-of-experts da 30 miliardi di parametri. Con W4A4KV4, PrismQuant ottiene i migliori risultati tra i metodi confrontati su Llama-3.2-3B, sia per perplexity sia per accuratezza. Su Llama-3.1-70B raggiunge una perplexity di 3,85 e un’accuratezza media zero-shot del 72,46%, appena 0,22 punti percentuali sotto la precisione piena. Nello studio sulla distribuzione di Llama-3.1-8B, la nostra implementazione ottimizzata accelera il prefill di 1,51 volte e la decodifica con CUDA Graph di 1,22 volte rispetto a baseline FP16 equivalenti, con un picco di memoria durante la decodifica inferiore del 56,34% e una latenza della decodifica con CUDA Graph superiore soltanto del 2,35% rispetto a Hadamard. Il codice è disponibile all’indirizzo https://github.com/ForeverBlue816/PrismQuant.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv