Ricerca
Campionamento basato sull’influenza sulla coda per la valutazione del CVaR di una politica
Politiche con rendimenti medi simili possono differire nettamente nei rari casi di fallimento, ma stimare con precisione il valore a rischio condizionato (CVaR) della coda inferiore può richiedere mol

- arXiv
- 2609.38096
- Pubblicato
- 2026-09-29
- Autori
- Pauline Bourigault, Xiaotong Ji, Matthieu Zimmer, Rasul Tutunov, Haitham Bou-Ammar
Abstract degli autori
Politiche con rendimenti medi simili possono differire nettamente nei rari casi di fallimento, ma stimare con precisione il valore a rischio condizionato (CVaR) della coda inferiore può richiedere molte simulazioni costose. Quando le diverse componenti condizionali di un flusso di lavoro stocastico possono essere interrogate separatamente, ci chiediamo come distribuire un budget di valutazione fisso per stimare con la massima precisione il CVaR di una politica fissata. Deriviamo, per ogni legge condizionale interrogabile, un’influenza sulla coda che riassume come la sua incertezza incida sul CVaR attraverso tutti i riutilizzi di Bellman. La varianza di tale influenza determina il limite di efficienza per un disegno fisso e l’allocazione di Neyman ideale. Tail-Influence Sampling (TIS) stima l’entità di queste influenze con un modello pilota e ridistribuisce le nuove interrogazioni verso i kernel più importanti per la coda; una variante ancorata alle frequenze di visita protegge da un’allocazione insufficiente nella fase pilota. A dimensione fissa e con un margine quantilico positivo, TIS raggiunge la varianza asintotica ideale e l’MSE al primo ordine, tenendo conto anche del costo della fase pilota, mentre la variante ancorata resta entro un fattore due rispetto alla soluzione ideale. Descriviamo inoltre un regime a griglia esatta in cui coincidono le allocazioni ottimali per la coda e per la media. Su CliffWalking, TIS riduce l’MSE del 41% rispetto alla misura di occupazione appresa e del 76% rispetto alle simulazioni complete, a parità di budget di transizioni conteggiate. Nei flussi di lavoro di revisione con modelli linguistici congelati, la variante ancorata di TIS supera una combinazione basata sull’influenza sulla media con la stessa regolarizzazione in 23 delle 24 configurazioni MMLU-Pro e ottiene un MSE 2,4-3,4$\times$ più basso rispetto alle simulazioni nelle revisioni FinQA con sei chiamate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv