Vai al contenuto
AI.info

Ricerca

DLoop: decodifica speculativa a cicli

La decodifica speculativa accelera la generazione autoregressiva nei grandi modelli linguistici. In ogni fase di proposta, un modello di bozza leggero propone token che il modello bersaglio verifica s

DLoop: decodifica speculativa a cicli
arXiv
2610.07659
Pubblicato
2026-10-06
Autori
Geonmo Gu, Byeongho Heo, HeeJae Jun, Yoohoon Kang, Sangmin Lee, Sangdoo Yun, Dongyoon Han

Abstract degli autori

La decodifica speculativa accelera la generazione autoregressiva nei grandi modelli linguistici. In ogni fase di proposta, un modello di bozza leggero propone token che il modello bersaglio verifica successivamente. Con modelli di bozza sempre più capaci, osserviamo che il modello bersaglio accetta spesso tutti i token prodotti in una fase di proposta. Eppure, ogni fase di proposta è seguita da una verifica, con conseguenti passaggi forward non necessari del modello bersaglio anche quando la proposta potrebbe proseguire. I metodi che adattano la lunghezza della bozza decidono durante la decodifica quanti token proporre prima di una verifica, ma aumentano l’accelerazione solo per i modelli di bozza autoregressivi. Con un modello di bozza parallelo, proseguire la proposta richiede inoltre gli stati nascosti del modello bersaglio relativi a token proposti che non sono ancora stati verificati. Proponiamo DLoop, una forma di decodifica speculativa a cicli che esegue in modo adattivo più fasi di proposta prima della verifica. DLoop continua a proporre token finché il modello di bozza rimane sicuro delle proprie proposte, poi verifica insieme tutti i token accumulati. Un addestramento che tiene conto dei cicli mantiene affidabile il modello di bozza nelle fasi di proposta aggiuntive, esponendolo ai propri stati nascosti relativi ai token proposti non verificati. Impiegando ulteriori passaggi forward del modello di bozza, DLoop riduce il numero di passaggi forward del modello bersaglio necessari per la verifica. Su diversi metodi di decodifica speculativa, tra cui EAGLE-3, DFlash, Domino, DSpark e i moduli di predizione multi-token, DLoop aumenta l’accelerazione misurata in tempo effettivo dal 5 al 41 per cento, preservando la decodifica senza perdita. Il codice sarà disponibile all’indirizzo https://github.com/naver-ai/DLoop.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv