Ricerca
Smussamento e validazione basati sulle previsioni per la valutazione disaggregata dell’IA
La valutazione di un sistema di IA richiede un’analisi disaggregata, poiché le prestazioni variano tra domini, come le tipologie di task dei benchmark o i tipi di conversazione degli agenti in produzi

- arXiv
- 2609.20758
- Pubblicato
- 2026-09-17
- Autori
- Sho Kawano, Zehang Richard Li, Paul A. Parker
Abstract degli autori
La valutazione di un sistema di IA richiede un’analisi disaggregata, poiché le prestazioni variano tra domini, come le tipologie di task dei benchmark o i tipi di conversazione degli agenti in produzione. Sottoporre a test ogni unità è costoso, quindi la valutazione si basa su un campione di unità etichettate. Consideriamo il set di valutazione come una popolazione finita e cerchiamo di ottenere stime puntuali e per intervallo accurate della media di ciascun dominio. Gli stimatori diretti, tra cui l’inferenza basata sulle previsioni (PPI), utilizzano solo le etichette del dominio in esame e sono imprecisi quando le etichette sono poche. La stima per piccole aree affronta questo problema; su questa base, sviluppiamo un flusso di lavoro integrato per la stima e la validazione. Per la stima, proponiamo lo smussamento basato sulle previsioni (PP-S), un modello bayesiano adattato alla stima di ciascun dominio basata sulle previsioni, con un’estensione che condivide informazioni tra le categorie di una tassonomia di rendicontazione (PP-TS). Per la validazione, ricaviamo un nuovo punteggio di convalida incrociata basato sul disegno campionario, approssimativamente non distorto, per scegliere tra stimatori diretti e smussati. Studiamo un benchmark selezionato con valutazioni verificabili e il traffico di agenti in produzione valutato da esseri umani, in entrambi i casi con tutti gli esiti osservati. In entrambi, gli stimatori proposti migliorano gli stimatori diretti nelle stime puntuali e per intervallo, con una copertura prossima al livello nominale. A parità di budget di campionamento, il nostro punteggio seleziona uno stimatore con la stessa efficacia di un campione di validazione indipendente e stima con molta più precisione l’errore dello stimatore selezionato.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv