Vai al contenuto
AI.info

Ricerca

Apprendimento online con esperti LLM a partire da un feedback limitato

Studiamo l’instradamento adattivo dei prompt verso esperti basati su modelli linguistici di grandi dimensioni (LLM), per massimizzare la qualità delle risposte in uno scenario online con un feedback l

Apprendimento online con esperti LLM a partire da un feedback limitato
arXiv
2609.05820
Pubblicato
2026-09-05
Autori
Wang Wei, Soumyabrata Pal, Koyel Mukherjee, Franck Dernoncourt, Ryan A. Rossi, Branislav Kveton, Hoda Eldardiry

Abstract degli autori

Studiamo l’instradamento adattivo dei prompt verso esperti basati su modelli linguistici di grandi dimensioni (LLM), per massimizzare la qualità delle risposte in uno scenario online con un feedback limitato. Formuliamo il problema come un problema bandit con $K$ azioni che rappresentano gli esperti e $d$ caratteristiche che codificano i prompt, su un orizzonte di $T$ turni. Proponiamo algoritmi che selezionano strategicamente quali ricompense osservare per ridurre al minimo il regret. Nello scenario a informazione completa otteniamo un regret di $\tilde{O}(d T / \sqrt{m})$, mentre nello scenario bandit otteniamo $\tilde{O}(d T \sqrt{K / m})$, dove $m \ll T$ è il budget di feedback. I nostri esperimenti mostrano che apprendiamo in modo efficiente strategie di instradamento di alta qualità tra diversi LLM a partire da un feedback limitato.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv