Ricerca
KVCMAS: correzione efficiente della cache KV per il contesto condiviso nei sistemi multiagente
I sistemi multiagente specializzati tramite prompt consentono a più agenti di condividere un modello e svolgere ruoli complementari per risolvere compiti complessi. Tuttavia, i prefissi specifici di c

- arXiv
- 2609.34060
- Pubblicato
- 2026-09-28
- Autori
- Hyesung Jeon, Hyeongju Ha, Seoyoung Lee, Beomseok Kang, Jae-Joon Kim
Abstract degli autori
I sistemi multiagente specializzati tramite prompt consentono a più agenti di condividere un modello e svolgere ruoli complementari per risolvere compiti complessi. Tuttavia, i prefissi specifici di ciascun agente modificano la cache KV generata per lo stesso contesto condiviso: ogni agente deve quindi eseguire ripetutamente il prefill di un contesto sempre più ampio e costruire una cache separata, con elevati costi computazionali e di memoria. Il ricalcolo selettivo riduce questa ridondanza, ma richiede ancora una notevole esecuzione del modello; i metodi di correzione delta esistenti, invece, supportano soltanto relazioni ricorrenti tra contesti oppure mantengono stati di correzione online che richiedono molta memoria per i contesti che cambiano dinamicamente. Quando il contesto condiviso viene incontrato per la prima volta, questi metodi costruiscono inoltre una cache di riferimento al di fuori del flusso di lavoro degli agenti, e una correzione approssimativa applicata al primo agente influisce sugli output trasmessi agli agenti successivi. Presentiamo KVCMAS, un framework di correzione online della cache KV che rappresenta le differenze tra le cache degli agenti mediante stati compatti a basso rango e concatena le correzioni lungo il flusso di lavoro degli agenti senza un prefill di riferimento aggiuntivo. Questa soluzione supporta contesti condivisi che cambiano dinamicamente, preservando al tempo stesso una cache esatta per il primo agente. Su diversi carichi di lavoro linguistici e visivo-linguistici, KVCMAS eguaglia o migliora l’accuratezza dei precedenti metodi di condivisione della cache KV e ottiene il TTFT più basso in condizioni di serving ad alta concorrenza. Su tracce di serving controllate, accelera il TTFT di 2,0 volte rispetto all’inferenza senza condivisione della cache KV e riduce il picco di memoria GPU fino a 3,7 volte rispetto a un precedente metodo di correzione della cache KV. Questi risultati dimostrano che KVCMAS è un approccio accurato e scalabile alla condivisione della cache KV per il serving di sistemi multiagente specializzati tramite prompt.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv