Vai al contenuto
AI.info

Ricerca

Quanto è senza perdita la decodifica speculativa senza perdita? Il ruolo della precisione numerica in Orthrus

Orthrus è un’architettura ibrida autoregressiva e diffusiva che accelera l’inferenza dei modelli linguistici autoregressivi generando più token in parallelo, pur utilizzando un backbone autoregressivo

Quanto è senza perdita la decodifica speculativa senza perdita? Il ruolo della precisione numerica in Orthrus
arXiv
2609.15504
Pubblicato
2026-09-14
Autori
Ilya Koziev, Leonid Sinev, Ivan Oseledets

Abstract degli autori

Orthrus è un’architettura ibrida autoregressiva e diffusiva che accelera l’inferenza dei modelli linguistici autoregressivi generando più token in parallelo, pur utilizzando un backbone autoregressivo con parametri congelati. La sua tesi centrale è che un meccanismo di consenso interno al modello consenta una decodifica speculativa senza perdita, producendo la stessa sequenza di output del modello autoregressivo. Abbiamo riprodotto Orthrus in modo indipendente ed esaminato questa tesi con diverse precisioni numeriche. Con l’inferenza in BF16, la corrispondenza esatta delle traiettorie si verifica solo nel 45% dei casi per il checkpoint degli autori e nel 43% per il modello che abbiamo addestrato indipendentemente, su 1.190 prompt provenienti da 12 ambiti. La probabilità di una corrispondenza esatta è inoltre fortemente associata alla perplexity del modello di riferimento condizionata alla risposta. Nonostante questa divergenza delle traiettorie, Orthrus non mostra un peggioramento sistematico nei benchmark a valle di lm-eval-harness. Al contrario, ripetendo la valutazione delle traiettorie con FP32, si ottiene una corrispondenza esatta per tutti i prompt valutati. Questi risultati mostrano che l’assenza di perdita di Orthrus nella pratica dipende dalla precisione numerica e che l’equivalenza esatta delle traiettorie va valutata separatamente dalle prestazioni nei compiti a valle.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv