Vai al contenuto
AI.info

Ricerca

I ciechi e l’elefante: sondare la miopia epistemica degli LLM di fronte a conoscenze divergenti della coda lunga

La risposta a domande fattuali (QA) presuppone di norma un’unica risposta canonica, nascondendo così se i modelli linguistici di grandi dimensioni (LLM) conservino versioni divergenti di fatti della c

I ciechi e l’elefante: sondare la miopia epistemica degli LLM di fronte a conoscenze divergenti della coda lunga
arXiv
2608.28478
Pubblicato
2026-08-28
Autori
Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun

Abstract degli autori

La risposta a domande fattuali (QA) presuppone di norma un’unica risposta canonica, nascondendo così se i modelli linguistici di grandi dimensioni (LLM) conservino versioni divergenti di fatti della coda lunga. Per colmare questa lacuna, presentiamo ElephantBench, un test delle conoscenze a libro chiuso composto da 1.094 domande generate mediante una pipeline basata su grafi e sottoponibile a verifica. La pipeline recupera documenti correlati da un corpus web a bassa esposizione, individua divergenze presenti nelle fonti e le trasforma in voci di QA con più versioni. Ogni risposta viene verificata sulla base dei documenti di origine e di autorevoli fonti pubbliche sul web, quindi esaminata da annotatori umani. Su 32 modelli, anche il migliore recupera entrambe le versioni soltanto per il 52,4% delle domande; per quasi tutte le domande restanti ne ricorda una ma omette l’altra. Aumentare le dimensioni del modello e il ragionamento in fase di inferenza migliora il recupero, ma non elimina questa incompletezza. L’analisi del corpus mostra inoltre che lo squilibrio nell’esposizione favorisce la versione dominante, mentre una maggiore esposizione alla versione minoritaria è associata a un recupero più completo. Questi risultati fanno di ElephantBench un test riproducibile delle conoscenze per diagnosticare la miopia epistemica nella memoria parametrica. Più in generale, la nostra pipeline per costruire benchmark basata su grafi offre un modo efficiente e scalabile per trasformare corpus della coda lunga in test delle conoscenze riconducibili alle fonti, contribuendo agli sforzi per valutare e migliorare il rigore epistemico degli LLM di prossima generazione. Il codice è disponibile all’indirizzo https://github.com/Tencent/ElephantBench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv