Ricerca
AgentRouter: instradamento eterogeneo dei modelli per workflow agentici multi-step a costo ottimale
I sistemi agentici aziendali che instradano ogni passaggio di una traiettoria verso un modello di frontiera sprecano il 60-80% del budget di inferenza per sottocompiti che modelli più piccoli gestisco

- arXiv
- 2609.22951
- Pubblicato
- 2026-09-19
- Autori
- Rudrendu Kumar Paul, Sourav Nandy
Abstract degli autori
I sistemi agentici aziendali che instradano ogni passaggio di una traiettoria verso un modello di frontiera sprecano il 60-80% del budget di inferenza per sottocompiti che modelli più piccoli gestiscono altrettanto bene. Le soluzioni di instradamento esistenti ottimizzano l’assegnazione delle query a turno singolo, ma ignorano una caratteristica peculiare dei workflow agentici: la complessità dei sottocompiti varia notevolmente all’interno di una stessa traiettoria. Un passaggio di pianificazione può richiedere capacità di ragionamento da modello di frontiera, mentre il successivo, dedicato alla formattazione, può essere gestito da un modello da 7B. Formalizziamo l’instradamento dei modelli a livello di singolo passaggio come un problema di assegnazione sequenziale lungo le traiettorie degli agenti e proponiamo AgentRouter, un classificatore leggero (12 milioni di parametri, <5ms di sovraccarico per passaggio su una GPU A100) che assegna ogni passaggio della traiettoria a una delle quattro fasce di modelli, utilizzando cinque caratteristiche ricavabili al momento dell’instradamento. Addestrato su 50.000 passaggi annotati di traiettorie di agenti, relativi ad attività di pianificazione, programmazione, ricerca e analisi dei dati, AgentRouter riduce i costi del 72% rispetto ai baseline che usano esclusivamente modelli di frontiera, mantenendo il 97,3% della qualità di questi ultimi (con un calo inferiore al 3% nel completamento delle attività end-to-end); l’accuratezza dell’instradamento per singolo passaggio raggiunge il 91% per i passaggi di complessità minima e l’85% per quelli della fascia efficiente, mentre si attesta tra il 76% e l’82% per le fasce intermedie e di frontiera, più difficili. Sugli stessi benchmark, RouteLLM e FrugalGPT (applicati a ogni singolo passaggio) riducono i costi rispettivamente solo del 31% e del 44%, perché il loro segnale di addestramento a turno singolo non coglie le dipendenze della qualità a livello di traiettoria.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv