Ricerca
Draft-KV: apprendere una comunicazione latente utile tra modelli linguistici
La comunicazione latente trasmette stati interni tra modelli linguistici anziché testo decodificato, ma una maggiore accuratezza del modello ricevente non dimostra che questo abbia utilizzato il conte

- arXiv
- 2609.34754
- Pubblicato
- 2026-09-28
- Autori
- Linquan Wu, Shichang Meng, Tianxiang Jiang, Haoyu Yang, Peng Zhong, Fengming Zhu, Xi Peng, Linqi Song, Jacky Keung, Jingyu Zhang
Abstract degli autori
La comunicazione latente trasmette stati interni tra modelli linguistici anziché testo decodificato, ma una maggiore accuratezza del modello ricevente non dimostra che questo abbia utilizzato il contenuto del messaggio. In cinque coppie metodo-dataset, sostituire ogni messaggio con uno relativo a una domanda non correlata modifica l’accuratezza di al massimo 0,60 punti, anche quando la comunicazione la aumenta di 15,44 punti rispetto al solo modello ricevente. Il miglioramento può quindi dipendere dall’interfaccia, mentre il modello mittente risulta superfluo. Draft-KV trasmette invece gli stati key-value generati mentre il modello mittente abbozza una risposta alla domanda corrente. Proiezioni lineari collocano questi stati in una memoria ausiliaria, consultata attraverso un ramo di attenzione con gating, e l’addestramento progressivo passa dalla ricostruzione del messaggio alla supervisione delle risposte, con un vincolo che limita i danni causati da messaggi non corrispondenti. Entrambi i modelli restano congelati e l’interfaccia addestra 1,05 milioni di parametri, 348 volte meno rispetto a C2C. Con Qwen3-8B come modello mittente, il modello ricevente Qwen2.5-0.5B-Instruct, mantenuto congelato, raggiunge il 78,04% su MMLU-Redux, contro il 37,45% da solo e il 36,40% con messaggi riassegnati. A parità di dimensioni dell’interfaccia, portare il modello mittente da 0,6 miliardi a 8 miliardi fa salire l’accuratezza dal 46,11% al 78,04%; la comunicazione si trasferisce anche a compiti esclusi dall’addestramento e può superare le prestazioni di entrambi i modelli quando ciascuno dispone di evidenze diverse.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv