Vai al contenuto
AI.info

Ricerca

LatentPort: oltre la cache KV - trasferimento tra modelli della memoria ricorrente nei modelli linguistici ibridi: passaggio di stato ibrido da 4B a 9B senza ripetere il prefisso nel modello ricevente

Un modello linguistico può trasferire la propria memoria attiva a un altro senza che il modello ricevente debba rileggere il contesto? Dimostriamo che è possibile trasferire in modo utile uno stato ib

LatentPort: oltre la cache KV - trasferimento tra modelli della memoria ricorrente nei modelli linguistici ibridi: passaggio di stato ibrido da 4B a 9B senza ripetere il prefisso nel modello ricevente
arXiv
2609.25053
Pubblicato
2026-09-07
Autori
Simon P. Villani

Abstract degli autori

Un modello linguistico può trasferire la propria memoria attiva a un altro senza che il modello ricevente debba rileggere il contesto? Dimostriamo che è possibile trasferire in modo utile uno stato ibrido persistente tra una coppia di modelli fratelli Qwen3.5 4B e 9B con architettura corrispondente. Per quanto ne sappiamo, questa è la prima dimostrazione di un passaggio tra modelli dello stato persistente ricorrente d’inferenza tra modelli linguistici ibridi di dimensioni diverse, senza ripetere il prefisso nel modello ricevente. La sola traduzione delle KV dell’attenzione lascia un ampio divario; aggiungendo il pacchetto di stato persistente Gated DeltaNet (GDN), la log-verosimiglianza negativa (NLL) in modalità teacher forcing — la log-loss media del token successivo — diminuisce di 0,747 nats/token (IC bootstrap appaiato al 95% a livello di documento [0,6921, 0,8047]), con un miglioramento su tutti i 64 documenti di PG19. Il riuso diretto degli stati ricorrente e convoluzionale supera le mappe GDN apprese sottoposte a test, in linea con una compatibilità funzionale parziale delle coordinate dello stato persistente. Un nuovo esperimento fattoriale sui componenti individua come configurazione migliore le KV tradotte insieme agli stati ricorrente e convoluzionale riutilizzati direttamente. Una correzione aggiuntiva di 434.176 parametri migliora questa configurazione di base su 64 nuovi documenti web: la loss di continuazione supera quella del 9B nativo di 0,076 nats/token (NLL in eccesso), la divergenza di Jensen-Shannon (JS) è 0,022 e il recupero del contesto nativo (NCR) è 0,918. Il 9B corretto supera significativamente l’inferenza continuata del 4B, elaborando zero token del prefisso storico. Le evidenze riguardano una sola direzione, una sola coppia di modelli Base con geometria corrispondente e continuazioni di 4K token in modalità teacher forcing; il criterio near-native non è stato superato, il ramo da 16K non è stato eseguito e l’equivalenza nella generazione libera e l’esistenza di un’interfaccia generale per gli stati restano da dimostrare.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv