Ricerca
HyQuant: quantizzazione a precisione ibrida per l’attenzione degli LLM
La quantizzazione è ampiamente adottata nell’addestramento e nell’inferenza degli LLM per ridurre i costi e migliorare l’efficienza. Tuttavia, quantizzare il modulo di \emph{attention} con un numero m

- arXiv
- 2608.27875
- Pubblicato
- 2026-08-28
- Autori
- Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin Ouyang, Feihu Zhou, Kun Zhang, Zhenyu Guo, Hao Pan, Guangtao Xue, Yiming Zhang
Abstract degli autori
La quantizzazione è ampiamente adottata nell’addestramento e nell’inferenza degli LLM per ridurre i costi e migliorare l’efficienza. Tuttavia, quantizzare il modulo di \emph{attention} con un numero molto basso di bit introduce spesso errori rilevanti e peggiora le prestazioni. I metodi esistenti si affidano soprattutto a tecniche di smoothing per gestire i valori anomali; noi proponiamo invece una quantizzazione ibrida per bilanciare meglio accuratezza ed efficienza. Presentiamo \textbf{HyQuant}, un framework efficiente di quantizzazione ibrida per l’attenzione degli LLM. HyQuant quantizza la maggior parte degli stati di attenzione in formati a basso numero di bit, mantenendo ad alta precisione un piccolo insieme di token delle linee verticali e di stati della finestra locale. Queste regioni, cruciali per l’accuratezza, vengono selezionate mediante segnali leggeri basati sui pattern di attenzione che tengono conto delle linee verticali, riducendo l’errore di quantizzazione con un overhead limitato. Nella fase di Prefill, HyQuant usa un operatore di attenzione quantizzata a precisione ibrida che mantiene a piena precisione i token delle linee verticali e una finestra scorrevole locale, quantizzando il resto del contesto. Nella fase di Decode, HyQuant applica lo stesso principio alla compressione della cache KV e combina la dequantizzazione KV con il calcolo dell’attenzione per migliorare l’efficienza nell’uso della memoria e dell’hardware. Su diversi compiti, modelli e dataset, HyQuant mantiene un’accuratezza pressoché senza perdite grazie a un’architettura estremamente semplice, dimostrando l’efficienza e la fattibilità pratica della quantizzazione ibrida per l’attenzione degli LLM. Il codice è disponibile all’indirizzo: https://github.com/jerrysfls/HyQuant .
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv