Vai al contenuto
AI.info

Ricerca

Costo totale dell’agentività: attribuzione esatta del costo dell’iniezione della memoria nei flussi di lavoro con più agenti basati su LLM

Ogni nodo di un flusso di lavoro con più agenti basato su modelli linguistici di grandi dimensioni (LLM) recupera contesto dalla memoria e lo inserisce nel proprio prompt. I token così inseriti vengon

Costo totale dell’agentività: attribuzione esatta del costo dell’iniezione della memoria nei flussi di lavoro con più agenti basati su LLM
arXiv
2609.23790
Pubblicato
2026-09-20
Autori
Vivek Kumar Singh, Preeti Priyam, Gautam Bhowmick

Abstract degli autori

Ogni nodo di un flusso di lavoro con più agenti basato su modelli linguistici di grandi dimensioni (LLM) recupera contesto dalla memoria e lo inserisce nel proprio prompt. I token così inseriti vengono fatturati come token di input allo stesso prezzo per token del prompt di sistema e della richiesta dell’utente. Gli strumenti di osservabilità per gli ambienti di produzione indicano il costo totale dei token, ma non distinguono quelli generati da un nodo da quelli che gli vengono forniti: per i team che pagano il conto, questa componente è quindi invisibile. Introduciamo il costo totale dell’agentività (TCA), una scomposizione del costo dei flussi di lavoro con più agenti in prompt di base, inferenza, iniezione della memoria, penalità per mancato recupero e componenti di accumulo del contesto, insieme a un metodo di attribuzione esatta: un conteggio dei token in due passaggi e non fatturabile, che misura direttamente i token inseriti invece di stimarli sulla base di indicatori indiretti come il conteggio delle parole. In un benchmark aziendale di 200 task eseguito con API di modelli reali, l’iniezione della memoria rappresenta il 13,6 per cento del costo variabile su cui può intervenire un ottimizzatore in fase di compilazione, circa il 12 per cento del costo totale fatturato, e la sua quota passa da zero strutturale con profondità del flusso di lavoro pari a uno al 27,6 per cento con profondità pari a sei. Nell’intervallo misurato, i token inseriti crescono linearmente con la profondità (R^2 = 0,9974, profondità da due a sei); un adattamento quadratico produce un coefficiente principale negativo, quindi a queste profondità i dati non mostrano una crescita convessa. Mostriamo che questa componente è controllabile a parità di fascia del modello: ridurre la capacità della finestra di recupero da 32 a 2 voci abbassa i token inseriti del 28,7 per cento, con una variazione dell’accuratezza che rientra nella variabilità tra seed. Dichiariamo in modo completo che, considerate isolatamente, le nostre trasformazioni di riscrittura del grafo sono pressoché neutre sul piano dei costi, che due dei cinque termini della scomposizione sono pari a zero per costruzione in questo banco di prova e che il costo totale del flusso di lavoro è dominato dall’assegnazione della fascia del modello, che manteniamo fissa e consideriamo oggetto di lavori precedenti. La memorizzazione nella cache dei prompt non è valutata; tutti i valori si riferiscono al caso senza cache.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv