Ricerca
Addestramento consapevole della verifica per la decodifica speculativa
La decodifica speculativa accelera l’inferenza dei grandi modelli linguistici usando un modello draft per generare token candidati, che il modello bersaglio verifica in un unico passaggio forward. La

- arXiv
- 2608.30135
- Pubblicato
- 2026-08-31
- Autori
- Geonmo Gu, Byeongho Heo, HeeJae Jun, Yoohoon Kang, Sangmin Lee, Sangdoo Yun, Dongyoon Han
Abstract degli autori
La decodifica speculativa accelera l’inferenza dei grandi modelli linguistici usando un modello draft per generare token candidati, che il modello bersaglio verifica in un unico passaggio forward. La verifica procede in sequenza e scarta tutte le posizioni dalla prima respinta in poi. L’addestramento dei modelli draft esistenti, però, si basa sull’imitazione del modello bersaglio a livello di token, con una ponderazione fissa per posizione che non tiene conto di nessuna delle due caratteristiche. Introduciamo Verification-Aware Training (VAT), un framework integrabile nei metodi esistenti che simula la verifica a ogni passo dell’addestramento e usa i conseguenti schemi di accettazione e rifiuto come segnali di supervisione. VAT comprende due componenti: (i) una verification head, un classificatore binario leggero addestrato congiuntamente al modello draft, che gli fornisce un segnale di supervisione sulla capacità di ciascuna posizione di superare la verifica sequenziale; (ii) una ponderazione adattiva alla verifica, che sostituisce lo schema di ponderazione fisso mantenendo il peso pieno fino alla prima posizione respinta di ciascun campione e facendo iniziare da lì la riduzione graduale dei pesi. VAT modifica soltanto l’obiettivo di addestramento e può quindi essere aggiunto ai metodi esistenti senza cambiare l’architettura del modello draft, il modello bersaglio o la procedura di inferenza. Applicato a EAGLE-3 e DFlash su Qwen3-4B, Qwen3-8B e LLaMA-3.1-8B, VAT aumenta la lunghezza media della sequenza accettata fino all’11,4% e l’accelerazione misurata in tempo effettivo fino all’8,7%, con miglioramenti costanti nei benchmark di matematica, codice e chat. Il codice sarà disponibile all’indirizzo https://github.com/naver-ai/vat
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv