Ricerca
Quanto è senza perdita la decodifica speculativa senza perdita? Il ruolo della precisione numerica in Orthrus
Orthrus è un’architettura ibrida autoregressiva e diffusiva che accelera l’inferenza dei modelli linguistici autoregressivi generando più token in parallelo, pur utilizzando un backbone autoregressivo

- arXiv
- 2609.15504
- Pubblicato
- 2026-09-14
- Autori
- Ilya Koziev, Leonid Sinev, Ivan Oseledets
Abstract degli autori
Orthrus è un’architettura ibrida autoregressiva e diffusiva che accelera l’inferenza dei modelli linguistici autoregressivi generando più token in parallelo, pur utilizzando un backbone autoregressivo con parametri congelati. La sua tesi centrale è che un meccanismo di consenso interno al modello consenta una decodifica speculativa senza perdita, producendo la stessa sequenza di output del modello autoregressivo. Abbiamo riprodotto Orthrus in modo indipendente ed esaminato questa tesi con diverse precisioni numeriche. Con l’inferenza in BF16, la corrispondenza esatta delle traiettorie si verifica solo nel 45% dei casi per il checkpoint degli autori e nel 43% per il modello che abbiamo addestrato indipendentemente, su 1.190 prompt provenienti da 12 ambiti. La probabilità di una corrispondenza esatta è inoltre fortemente associata alla perplexity del modello di riferimento condizionata alla risposta. Nonostante questa divergenza delle traiettorie, Orthrus non mostra un peggioramento sistematico nei benchmark a valle di lm-eval-harness. Al contrario, ripetendo la valutazione delle traiettorie con FP32, si ottiene una corrispondenza esatta per tutti i prompt valutati. Questi risultati mostrano che l’assenza di perdita di Orthrus nella pratica dipende dalla precisione numerica e che l’equivalenza esatta delle traiettorie va valutata separatamente dalle prestazioni nei compiti a valle.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv