Vai al contenuto
AI.info

Ricerca

SquidAgent: parallelizzare con criterio, coordinare in modo efficiente

Gli agenti basati su LLM risolvono compiti complessi articolati in più fasi, ma l’esecuzione sequenziale comporta una latenza considerevole. In linea di principio, distribuire il lavoro in parallelo t

SquidAgent: parallelizzare con criterio, coordinare in modo efficiente
arXiv
2610.08647
Pubblicato
2026-10-06
Autori
Yexiong Lin, Shanshan Ye, Yu Yao, Zhen Fang, Bo Han, Tongliang Liu

Abstract degli autori

Gli agenti basati su LLM risolvono compiti complessi articolati in più fasi, ma l’esecuzione sequenziale comporta una latenza considerevole. In linea di principio, distribuire il lavoro in parallelo tra più agenti dovrebbe produrre accelerazioni quasi lineari. Eppure, i sistemi multi-agente paralleli esistenti sono spesso più lenti di un sistema di riferimento con un solo agente. Attribuiamo questo divario a due costi nascosti che l’esecuzione parallela comporta e che un agente sequenziale evita. Il primo è il costo di riesplorazione: il lavoro ridondante che gli agenti esecutori svolgono per ricostruire un contesto già noto all’orchestratore, come le decisioni precedenti, e che in un’esecuzione sequenziale verrebbe invece ereditato implicitamente. Il secondo è il costo di allineamento: il lavoro necessario per risolvere le incongruenze tra risultati generati indipendentemente. Ne ricaviamo quindi un criterio decisionale fondato: un livello va parallelizzato solo quando il costo del suo percorso critico, sommato ai costi di riesplorazione e allineamento, è inferiore al corrispondente costo dell’esecuzione sequenziale. Sebbene questo criterio si esprima naturalmente in termini di tempo effettivo di esecuzione, osserviamo che gli LLM stimano male la durata dei compiti. Per questo misuriamo invece il costo in token di output previsti: riscontriamo empiricamente che gli LLM riescono a stimarli con un’affidabilità nettamente maggiore rispetto al tempo effettivo di esecuzione. Su questo criterio basato sui token proponiamo SquidAgent. Il sistema stima tutti i budget di token in un’unica fase di pianificazione, crea una diramazione per ciascun agente esecutore direttamente dalla sessione dell’orchestratore per eliminare il costo di riesplorazione e sostituisce la riconciliazione a posteriori con un blocco di convenzioni condivise generato in anticipo, trasformando l’allineamento in un costo iniziale limitato. Uno scheduler deterministico applica poi il criterio livello per livello. Nei test, SquidAgent ottiene un aumento medio del throughput di 2,2$\times$ e un’accelerazione media di 2,6$\times$ in termini di tempo effettivo di esecuzione rispetto a Claude Code, oltre a un aumento del throughput di 2,0$\times$ rispetto al miglior sistema multi-agente di riferimento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv