Ricerca
La comunicazione latente condizionata dal destinatario dà il 94% di CacheBack
I sistemi multiagente distribuiscono contesti ampi tra agenti che comunicano per risolvere un compito. I messaggi di testo sono compatti, ma richiedono la decodifica e possono omettere elementi di cui

- arXiv
- 2609.32046
- Pubblicato
- 2026-09-25
- Autori
- Maximillian Rossi, Prajwal Raghunath, Haoqing Xuan, Yusen Zhang, Eugene Wu
Abstract degli autori
I sistemi multiagente distribuiscono contesti ampi tra agenti che comunicano per risolvere un compito. I messaggi di testo sono compatti, ma richiedono la decodifica e possono omettere elementi di cui l’agente destinatario ha bisogno. I metodi recenti di comunicazione latente trasferiscono invece le cache KV. Questo evita la generazione di testo e può migliorare accuratezza e latenza. Tuttavia, una cache KV completa cresce linearmente sia con il contesto elaborato da ciascun agente sia con il numero di agenti che si coordinano. Aumentano così i costi in termini di memoria e contesto, spesso ben oltre le risorse GPU disponibili e le dimensioni delle finestre di contesto. La nostra osservazione fondamentale è che gli agenti devono inviare solo ciò che serve all’agente destinatario per il suo compito locale: è ciò che chiamiamo comunicazione condizionata dal destinatario. L’agente destinatario trasmette al mittente una breve descrizione delle informazioni di cui ha bisogno, che serve a filtrare e comprimere la cache KV dell’agente mittente. CacheBack è un’applicazione semplice e robusta del condizionamento basato sul destinatario che non richiede addestramento e si basa sui pesi di attenzione del mittente. Su FanOutQA, CacheBack con Qwen 3 elimina il 75% dello stato che l’agente riceverebbe altrimenti, migliorando l’accuratezza di 14,7 punti percentuali e riducendo di un fattore 3,2 la latenza mediana di completamento del compito rispetto alla comunicazione testuale. Mostriamo miglioramenti comparabili in famiglie di modelli che comprendono transformer densi, ibridi Mamba-attention e modelli con attenzione a finestra scorrevole.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv