Ricerca
Apprendimento online con esperti LLM a partire da un feedback limitato
Studiamo l’instradamento adattivo dei prompt verso esperti basati su modelli linguistici di grandi dimensioni (LLM), per massimizzare la qualità delle risposte in uno scenario online con un feedback l

- arXiv
- 2609.05820
- Pubblicato
- 2026-09-05
- Autori
- Wang Wei, Soumyabrata Pal, Koyel Mukherjee, Franck Dernoncourt, Ryan A. Rossi, Branislav Kveton, Hoda Eldardiry
Abstract degli autori
Studiamo l’instradamento adattivo dei prompt verso esperti basati su modelli linguistici di grandi dimensioni (LLM), per massimizzare la qualità delle risposte in uno scenario online con un feedback limitato. Formuliamo il problema come un problema bandit con $K$ azioni che rappresentano gli esperti e $d$ caratteristiche che codificano i prompt, su un orizzonte di $T$ turni. Proponiamo algoritmi che selezionano strategicamente quali ricompense osservare per ridurre al minimo il regret. Nello scenario a informazione completa otteniamo un regret di $\tilde{O}(d T / \sqrt{m})$, mentre nello scenario bandit otteniamo $\tilde{O}(d T \sqrt{K / m})$, dove $m \ll T$ è il budget di feedback. I nostri esperimenti mostrano che apprendiamo in modo efficiente strategie di instradamento di alta qualità tra diversi LLM a partire da un feedback limitato.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv