Ricerca
FlexRouter: apprendere insiemi complementari di modelli per l’instradamento flessibile degli LLM
I metodi esistenti per l’instradamento dei modelli linguistici di grandi dimensioni (LLM) valutano ciascun modello indipendentemente dagli altri per selezionare i migliori $k$. Questo approccio, però,

- arXiv
- 2609.38585
- Pubblicato
- 2026-09-29
- Autori
- Wang Wei, Harry Yang, Tiankai Yang, Samyadeep Basu, Hongjie Chen, Andy Zhao, Franck Dernoncourt, Ryan A. Rossi, Hoda Eldardiry
Abstract degli autori
I metodi esistenti per l’instradamento dei modelli linguistici di grandi dimensioni (LLM) valutano ciascun modello indipendentemente dagli altri per selezionare i migliori $k$. Questo approccio, però, ignora le correlazioni tra modelli e impone un budget computazionale rigido. Di conseguenza, i sistemi di instradamento selezionano spesso modelli ridondanti che condividono le stesse modalità di errore, limitando la probabilità complessiva di successo. Per affrontare il problema, proponiamo FlexRouter, un sistema di instradamento che modella esplicitamente la complementarità tra modelli. FlexRouter ottimizza la \textit{answer coverage}, massimizzando la probabilità che almeno uno dei modelli selezionati produca una risposta corretta. Questo obiettivo è coerente con le pipeline di inferenza pratiche, in cui vengono generate più risposte candidate e un verificatore a valle o un utente sceglie quella finale. Formuliamo l’instradamento come un problema di selezione di sottoinsiemi orientato alla copertura e modelliamo la politica di instradamento mediante processi puntuali determinantali (DPP), che colgono naturalmente sia la competenza dei modelli sia la loro ridondanza. Per ottimizzare direttamente la copertura senza richiedere un sottoinsieme bersaglio di riferimento, introduciamo un obiettivo di addestramento basato sulla marginalizzazione sugli insiemi di fallimento. Durante l’inferenza, adottiamo una strategia greedy basata sugli incrementi marginali del log-determinante, che consente al sistema di determinare in modo adattivo le dimensioni dei sottoinsiemi senza un budget predefinito. Esperimenti approfonditi sul benchmark su larga scala RouterEval mostrano che FlexRouter ottiene una copertura maggiore e una ridondanza minore rispetto a solide alternative, sia nei compiti appartenenti al dominio di addestramento sia in quelli esterni, mantenendo flessibile il costo dell’inferenza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv