Vai al contenuto
AI.info

Ricerca

Addestramento consapevole della verifica per la decodifica speculativa

La decodifica speculativa accelera l’inferenza dei grandi modelli linguistici usando un modello draft per generare token candidati, che il modello bersaglio verifica in un unico passaggio forward. La

Addestramento consapevole della verifica per la decodifica speculativa
arXiv
2608.30135
Pubblicato
2026-08-31
Autori
Geonmo Gu, Byeongho Heo, HeeJae Jun, Yoohoon Kang, Sangmin Lee, Sangdoo Yun, Dongyoon Han

Abstract degli autori

La decodifica speculativa accelera l’inferenza dei grandi modelli linguistici usando un modello draft per generare token candidati, che il modello bersaglio verifica in un unico passaggio forward. La verifica procede in sequenza e scarta tutte le posizioni dalla prima respinta in poi. L’addestramento dei modelli draft esistenti, però, si basa sull’imitazione del modello bersaglio a livello di token, con una ponderazione fissa per posizione che non tiene conto di nessuna delle due caratteristiche. Introduciamo Verification-Aware Training (VAT), un framework integrabile nei metodi esistenti che simula la verifica a ogni passo dell’addestramento e usa i conseguenti schemi di accettazione e rifiuto come segnali di supervisione. VAT comprende due componenti: (i) una verification head, un classificatore binario leggero addestrato congiuntamente al modello draft, che gli fornisce un segnale di supervisione sulla capacità di ciascuna posizione di superare la verifica sequenziale; (ii) una ponderazione adattiva alla verifica, che sostituisce lo schema di ponderazione fisso mantenendo il peso pieno fino alla prima posizione respinta di ciascun campione e facendo iniziare da lì la riduzione graduale dei pesi. VAT modifica soltanto l’obiettivo di addestramento e può quindi essere aggiunto ai metodi esistenti senza cambiare l’architettura del modello draft, il modello bersaglio o la procedura di inferenza. Applicato a EAGLE-3 e DFlash su Qwen3-4B, Qwen3-8B e LLaMA-3.1-8B, VAT aumenta la lunghezza media della sequenza accettata fino all’11,4% e l’accelerazione misurata in tempo effettivo fino all’8,7%, con miglioramenti costanti nei benchmark di matematica, codice e chat. Il codice sarà disponibile all’indirizzo https://github.com/naver-ai/vat

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv