Ricerca
Annotazione controfattuale da più fonti con vincolo di budget per la valutazione off-policy
La valutazione off-policy (OPE) stima il valore di una policy bersaglio a partire da dati registrati, ma una copertura limitata da parte della policy comportamentale può imporre una riponderazione ad

- arXiv
- 2610.10974
- Pubblicato
- 2026-10-07
- Autori
- Biao Xiang, Ali Eshragh, Yuexing Li, Kai Wang
Abstract degli autori
La valutazione off-policy (OPE) stima il valore di una policy bersaglio a partire da dati registrati, ma una copertura limitata da parte della policy comportamentale può imporre una riponderazione ad alta varianza o l’estrapolazione del modello di ricompensa. Le annotazioni controfattuali possono fornire informazioni sulle azioni non osservate, ma le fonti utilizzabili nella pratica, tra cui gli esperti del settore e i modelli linguistici di grandi dimensioni (LLMs), possono essere costose, distorte o rumorose. Studiamo come acquisire queste annotazioni con un budget limitato per la OPE nei bandit contestuali. Dati costi e profili d’errore specifici per ciascuna fonte, formuliamo un problema di allocazione intera tra coppie contesto-azione e fonti di annotazione, con l’obiettivo di ridurre al minimo la componente della varianza dello stimatore che dipende dal piano di annotazione. Individuiamo le condizioni in cui le annotazioni sono utili mediante una soglia per la prima annotazione e regimi locali del valore delle annotazioni. Per il problema con più fonti interdipendenti, sviluppiamo un algoritmo di maggiorazione-minimizzazione con sottoprocedure di programmazione dinamica che migliora monotonicamente la funzione obiettivo. Esperimenti su bandit clinici sintetici e bandit nel settore dell’istruzione annotati da LLM mostrano che il nostro metodo di allocazione riduce l’errore quadratico medio (MSE) a profilo fisso rispettivamente del 20,58% e del 10,77% rispetto all’assenza di annotazioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv