Ricerca
Quantizzazione disaggregata: specializzare il prefill e il decode degli LLM
Prefill e decode traggono vantaggio da approcci diversi alla quantizzazione: l’aritmetica a bassa precisione accelera l’elaborazione dei prompt, mentre pesi più compatti riducono il traffico di memori

- arXiv
- 2609.26333
- Pubblicato
- 2026-09-22
- Autori
- Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi, Tijmen Blankevoort, Dan Alistarh
Abstract degli autori
Prefill e decode traggono vantaggio da approcci diversi alla quantizzazione: l’aritmetica a bassa precisione accelera l’elaborazione dei prompt, mentre pesi più compatti riducono il traffico di memoria durante la generazione. Proponiamo la «quantizzazione disaggregata» (DQ), che adatta i formati di calcolo, i pesi e la collocazione in memoria a ciascuna delle due fasi. Su Qwen 3 e Gemma 3, eliminare la quantizzazione delle attivazioni soltanto nel decode migliora l’accuratezza nei compiti che richiedono molto decode senza aumentare il costo dell’inferenza. Addestrare pesi separati per il prefill, nativi per il calcolo, accelera l’elaborazione dei prompt rispetto all’inferenza con quantizzazione dei soli pesi, eguagliandone o superandone l’accuratezza con un decode a 2-3 bit sia nei compiti che richiedono molto decode sia in quelli che richiedono molto prefill. Con i decoder GGUF di Qwen3.8-27B resi disponibili, addestrare un prefiller NVFP4 migliora l’accuratezza a 1 bit di 32,5 punti su MMLU-Pro e di 35,3 su MMMU-Pro senza modificare il checkpoint del decode. Per ospitare il checkpoint aggiuntivo su un singolo dispositivo, il prefill disaggregato con offload (ODP) trasferisce i propri pesi in streaming dall’SSD, ammortizzando il caricamento lungo il prompt. Sullo stesso modello 27B, con prompt lunghi 8K, ODP riduce il tempo al primo token di un fattore 1,78 rispetto alla configurazione di riferimento con quantizzazione dei soli pesi in llama.cpp. Valutiamo l’accuratezza con prefill e decode serviti separatamente in vLLM e convalidiamo ulteriormente la disaggregazione dei formati con pesi condivisi mediante quantizzazione post-addestramento su modelli fino a 2,8T parametri.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv