Vai al contenuto
AI.info

Ricerca

La calibrazione come criterio fondamentale nella valutazione degli LLM

La calibrazione dei modelli linguistici — la corrispondenza tra la confidenza espressa o implicita e la correttezza empirica — è un ambito di studio consolidato nell’NLP. Esistono già metodi per misur

La calibrazione come criterio fondamentale nella valutazione degli LLM
arXiv
2609.26489
Pubblicato
2026-09-22
Autori
Mario Sanz-Guerrero, Katharina von der Wense

Abstract degli autori

La calibrazione dei modelli linguistici — la corrispondenza tra la confidenza espressa o implicita e la correttezza empirica — è un ambito di studio consolidato nell’NLP. Esistono già metodi per misurarla. Il problema è la loro adozione: al di fuori di questo ambito, la ricerca nell’NLP presenta regolarmente nuovi modelli, dataset e benchmark senza verificare se i punteggi di confidenza del modello siano significativi. Sosteniamo che questa mancata adozione sia un ostacolo importante a una valutazione affidabile degli LLM. Una calibrazione inadeguata crea problemi in due ambiti distinti: nell’impiego del modello, dove gli errori accompagnati da un’eccessiva sicurezza causano danni reali, e nel processo di ricerca, dove metodi come LLM-as-a-judge, la generazione di dati sintetici e l’apprendimento attivo si basano su una confidenza calibrata senza verificarla. Le metriche standard di calibrazione richiedono soltanto due dati per ogni esempio: un punteggio di confidenza e un giudizio di correttezza. La maggior parte dei benchmark oggi in uso fornisce già entrambi, il che significa che la calibrazione può essere riportata fin da subito. Per la generazione aperta, tuttavia, definire questi due dati resta una questione aperta. Sosteniamo che ogni ambito dell’NLP debba affiancare alla propria principale metrica di prestazione un punteggio di calibrazione e chiediamo che la calibrazione sia considerata una proprietà essenziale di ogni modello, anziché un tema di nicchia.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv