Ricerca
Aggregazione di modelli linguistici e previsioni a priori in base alla competenza per prevedere eventi
Nella previsione ibrida, un modello linguistico è spesso uno dei vari segnali disponibili. Un sistema può già disporre di una previsione di mercato, collettiva o statistica e deve decidere se il model

- arXiv
- 2609.12101
- Pubblicato
- 2026-09-14
- Autori
- Aditi Tiwari, Aashrith Bandaru, Heng Ji
Abstract degli autori
Nella previsione ibrida, un modello linguistico è spesso uno dei vari segnali disponibili. Un sistema può già disporre di una previsione di mercato, collettiva o statistica e deve decidere se il modello aggiunga informazioni utili o debba essere ignorato. L’obiettivo da valutare non è quindi l’accuratezza del modello preso da solo, ma la sua competenza relativa, definita come il valore marginale che apporta rispetto alla previsione esterna disponibile. Nell’ambito della perdita di Brier, caratterizziamo le condizioni in cui il disaccordo del modello può migliorare una previsione esterna e ricaviamo il vantaggio derivante dall’uso di pesi di aggregazione specifici per dominio anziché globali. Introduciamo poi un meccanismo di selezione basato sulla competenza che stima i pesi delle fonti per ciascun dominio a partire dagli esiti noti, avvicina le stime incerte a un peso globale e ricalibra la previsione aggregata. Su 2.357 domande binarie con esito noto e cinque modelli linguistici, il meccanismo migliora il principale riferimento esterno, portando il punteggio Brier da 0,0771 a 0,0732, e supera in modo significativo le combinazioni globali di previsioni. Il vantaggio resta significativo con controlli contro la contaminazione dei dati e rispetto a una previsione a priori basata su serie temporali che evita tale contaminazione, sull’insieme strutturato aggregato; vi sono inoltre evidenze separate su FRED. Per contro, il meccanismo non produce miglioramenti significativi nel sottoinsieme ufficiale di ForecastBench relativo al mercato, dove perlopiù si affida alla previsione di mercato. Su quattro modelli Qwen, la fiducia espressa verbalmente non indica in modo affidabile quando il modello supera la previsione esterna, mentre la competenza stimata dagli esiti consente di decidere meglio quando astenersi. Questi risultati offrono un approccio pratico all’uso selettivo dei modelli basato sul loro valore marginale misurato.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv