Vai al contenuto
AI.info

Ricerca

Trasferimento della cache KV tra famiglie diverse senza prefill per LLM multiagente eterogenei

I sistemi multiagente basati su LLM combinano sempre più spesso modelli eterogenei per assegnare agli agenti ruoli specializzati. Tuttavia, quando la comunicazione avviene tramite testo, ogni destinat

Trasferimento della cache KV tra famiglie diverse senza prefill per LLM multiagente eterogenei
arXiv
2609.32259
Pubblicato
2026-09-26
Autori
Vincent-Daniel Yun, Woosang Lim, Haneul Yoo, Sungjoo Yoo, Murali Annavaram, Sai Praneeth Karimireddy

Abstract degli autori

I sistemi multiagente basati su LLM combinano sempre più spesso modelli eterogenei per assegnare agli agenti ruoli specializzati. Tuttavia, quando la comunicazione avviene tramite testo, ogni destinatario deve eseguire il prefill del contesto condiviso già elaborato dal mittente. Riutilizzare la cache key-value (KV) del mittente evita questa ridondanza, ma il trasferimento senza prefill tra famiglie di modelli diverse deve gestire differenze nella tokenizzazione, nella profondità dei modelli e nelle rappresentazioni KV. Per affrontare questi problemi proponiamo \textit{HeteroFold}, un metodo di trasferimento della cache KV tra famiglie diverse senza prefill che lascia invariati sia il mittente sia il destinatario. HeteroFold allinea le strutture dei modelli, mappa la cache del mittente nello spazio del destinatario e la calibra per preservare il comportamento di quest’ultimo. In sei direzioni di trasferimento, HeteroFold ottiene le migliori prestazioni nel trasferimento della cache in tutti e quattro i benchmark con contesto lungo e nella maggior parte delle configurazioni con contesto breve. Eguaglia inoltre la comunicazione basata sul testo nel benchmark multiagente. Con una lunghezza del contesto di 32K, il trasferimento Llama-3.1-8B$\rightarrow$Ministral-3-14B è $10.7\times$ più veloce di Native Prefill e $1.18$--$1.47\times$ più veloce delle soluzioni di riferimento senza prefill più avanzate, Dense Latent e KV Ridge. Questi risultati mostrano che HeteroFold consente di riutilizzare in modo efficiente le cache KV tra famiglie diverse senza che il destinatario debba eseguire il prefill.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv