Ricerca
Il routing dovrebbe ripagarsi da sé: supervisione sparsa per un routing economico dei LLM
Il routing dei modelli linguistici di grandi dimensioni (LLM) riduce i costi di erogazione assegnando ogni query a un modello appropriato senza compromettere la qualità delle risposte. Addestrare un r

- arXiv
- 2609.37402
- Pubblicato
- 2026-09-29
- Autori
- Guannan Lai, Gelin Bian, Hao-Xuan Ma, Jun-Peng Jiang, Long Chen, Jian-Dong Liu, Zhi-Hao Tan, Han-Jia Ye
Abstract degli autori
Il routing dei modelli linguistici di grandi dimensioni (LLM) riduce i costi di erogazione assegnando ogni query a un modello appropriato senza compromettere la qualità delle risposte. Addestrare un router di questo tipo, tuttavia, richiede spesso di eseguire più modelli candidati su query passate per raccogliere valutazioni della qualità per ciascuna coppia query-modello, con un costo di supervisione non trascurabile prima dell’impiego. I lavori esistenti si concentrano soprattutto sull’efficienza durante l’erogazione del servizio, trascurando la questione se i risparmi ottenuti siano sufficienti a recuperare questa spesa iniziale. Osserviamo inoltre che la qualità del routing spesso raggiunge un plateau ben prima che siano raccolte tutte le valutazioni per le coppie query-modello: una supervisione densa può quindi risultare eccessiva sotto il profilo economico. Proponiamo SaveRouter, un framework di routing con supervisione sparsa che acquisisce selettivamente valutazioni informative dei modelli e condivide informazioni sulle loro capacità tra query correlate, mantenendo al tempo stesso un affinamento a livello di singola query per un routing più preciso. Valutiamo il routing considerando congiuntamente la spesa per la supervisione e i successivi risparmi nell’erogazione del servizio. Su quattro benchmark di routing, la configurazione principale utilizza solo circa il 33–41% delle valutazioni disponibili per l’addestramento, pur mantenendo una qualità del routing competitiva o superiore, e riduce di circa 1,9–9,5 volte il volume di utilizzo necessario per raggiungere il punto di pareggio rispetto al router convenzionale più veloce. Ulteriori analisi mostrano che acquisire più valutazioni per la supervisione non è sempre economicamente preferibile: il livello di supervisione che riduce al minimo i costi di erogazione può essere diverso da quello che consente di recuperare prima la spesa iniziale. Il nostro codice è disponibile pubblicamente all’indirizzo https://github.com/LAMDA-Model-Reuse/SaveRouter.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv