Vai al contenuto
AI.info

Ricerca

Valutazione adattiva consapevole del rischio: individuare gli errori ad alto impatto con budget limitati

Valutare gli agenti interattivi è costoso. Il comportamento degli agenti è stocastico, quindi l’affidabilità deve essere misurata con prove ripetute; gli errori, però, sono rari e differiscono molto p

Valutazione adattiva consapevole del rischio: individuare gli errori ad alto impatto con budget limitati
arXiv
2609.38914
Pubblicato
2026-09-30
Autori
Priyanath Maji, Spandan Ghose Chowdhury

Abstract degli autori

Valutare gli agenti interattivi è costoso. Il comportamento degli agenti è stocastico, quindi l’affidabilità deve essere misurata con prove ripetute; gli errori, però, sono rari e differiscono molto per la loro gravità. I benchmark tradizionali distribuiscono questo budget in modo uniforme: una consultazione in sola lettura viene testata con la stessa frequenza di un’azione di pagamento irreversibile. Noi formuliamo invece la valutazione come un problema di allocazione sequenziale. Dati un budget fisso di prove e un insieme di scenari il cui comportamento rispetto agli errori è sconosciuto, quali scenari vanno eseguiti, e quali vanno eseguiti di nuovo? Proponiamo una strategia di Thompson Sampling contestuale consapevole del rischio, che combina un vettore di contesto dello scenario disponibile prima dell’esecuzione e un punteggio d’impatto fisso con gli esiti osservati durante la valutazione. La testiamo mediante riproduzione offline su 70 scenari di $τ$-bench relativi al trasporto aereo e 824 prove registrate. Il risultato principale riguarda il budget più ridotto: con sole 50 prove ($6\%$ del corpus), la strategia individua l’$86\%$ degli errori ponderati per impatto che un oracolo potrebbe trovare, contro il $25\%$ dell’allocazione uniforme. Con lo stesso numero di prove scopre $3.5\times$ più errori ponderati per impatto (215,4 contro 62,2), ottiene $5\times$ più scoperte per dollaro e riduce dal $34\%$ al $2.8\%$ il budget sprecato in scenari in cui non si verificano mai errori. Il resto della nostra analisi dimostra questo risultato e ne precisa i limiti: un confronto su diversi livelli di budget mostra che il vantaggio si riduce man mano che il budget si avvicina alla dimensione del corpus, mentre test di significatività per dati appaiati mostrano che il contesto degli scenari è utile soprattutto con budget ridotti e l’esplorazione basata sulla distribuzione a posteriori con budget intermedi. L’allocazione adattiva consapevole del rischio è quindi più utile proprio quando il budget per la valutazione è più scarso.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv