Vai al contenuto
AI.info

Ricerca

Perché Gated DeltaNet resiste alla quantizzazione a 4 bit: NVFP4 W4A4 per la metà ricorrente di un LLM ibrido da 27B

Gli LLM ibridi combinano l’attenzione softmax con livelli di attenzione lineare come Gated DeltaNet (GDN), il cui stato ricorrente riassume il contesto in una dimensione fissa. Le prime quantizzazioni

Perché Gated DeltaNet resiste alla quantizzazione a 4 bit: NVFP4 W4A4 per la metà ricorrente di un LLM ibrido da 27B
arXiv
2609.04098
Pubblicato
2026-09-03
Autori
Sergii Kozyrev, Davyd Maiboroda

Abstract degli autori

Gli LLM ibridi combinano l’attenzione softmax con livelli di attenzione lineare come Gated DeltaNet (GDN), il cui stato ricorrente riassume il contesto in una dimensione fissa. Le prime quantizzazioni a 4 bit di Qwen3.8-27B realizzate dalla comunità (48 livelli GDN, 16 livelli di attenzione) mantenevano il blocco GDN a una precisione di 8 o 16 bit — soprattutto i gate che regolano il decadimento e l’intensità della scrittura — in base all’intuizione che gli errori in una ricorrenza si accumulino su contesti lunghi. Mettiamo alla prova questa intuizione realizzando Minima: NVFP4 W4A4 su tutti i 496 livelli lineari, inclusi quelli GDN. Nelle valutazioni della perplexity a 4K/32K, di MMLU-Pro, GSM8K, AIME’25, GPQA-Diamond, LiveCodeBench e del recupero di informazioni con RULER fino a 64K, Minima eguaglia BF16 entro la variabilità dovuta al seed (media su 5 attività: -0,52), pur essendo la configurazione più piccola (17,5 GiB) e quella con il prefill più veloce (+14-19%) tra quelle confrontate; inoltre, il suo divario di perplexity a 32K si riduce con l’avanzare della posizione nel contesto. Uno studio del meccanismo in quattro parti spiega perché: (i) la scalatura a blocchi di 16 elementi di NVFP4 confina gli outlier estremi del flusso residuo, uniformando l’errore delle attivazioni tra i diversi ruoli dei livelli; (ii) le proiezioni dei gate, ritenute fragili, sono invece le meno sensibili: le parametrizzazioni softplus/esponenziale e sigmoide riducono un errore GEMM di circa l’11% a un errore nell’output di circa il 2%; (iii) la ricorrenza basata sulla regola delta mantiene il rumore introdotto su un plateau stabile per 32K token e dimentica un impulso nello stato entro poche centinaia di passi, perché ogni scrittura sovrascrive lo stato lungo la direzione della chiave corrente; (iv) il costo della quantizzazione per token si diluisce con l’aumentare del contesto, anziché accumularsi. Correggiamo inoltre una discrepanza nella scala globale che si presenta quando checkpoint NVFP4 calibrati separatamente per ciascun modulo vengono eseguiti con kernel che fondono quei moduli in un’unica GEMM, e mostriamo che le scale calibrate per la cache KV in FP8 non comportano penalizzazioni delle prestazioni. Il risultato è una ricetta pratica — quantizzare tutto e distribuire le scale KV — e una spiegazione dei meccanismi per cui la metà ricorrente di un LLM ibrido è la metà più facile da quantizzare. Checkpoint: https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv