Ricerca
SpanCalib-VLM: rilevamento calibrato dei segmenti di allucinazione nei modelli visivo-linguistici
Rilevare le allucinazioni nei grandi modelli visivo-linguistici (LVLM) richiede sia di localizzare con precisione i segmenti di testo sia di assegnare punteggi di confidenza ben calibrati. I VLM gener

- arXiv
- 2608.29974
- Pubblicato
- 2026-08-30
- Autori
- Amanuel Gizachew Abebe, Yasmin Moslem
Abstract degli autori
Rilevare le allucinazioni nei grandi modelli visivo-linguistici (LVLM) richiede sia di localizzare con precisione i segmenti di testo sia di assegnare punteggi di confidenza ben calibrati. I VLM generativi sottoposti a fine-tuning eccellono nell’individuare i segmenti di testo allucinati, ma tendono a essere troppo sicuri delle proprie risposte e hanno un’elevata latenza di inferenza. I modelli discriminativi per l’etichettatura di sequenze offrono velocità deterministica e una calibrazione migliore, ma hanno un recall contenuto per i segmenti. Presentiamo SpanCalib-VLM, un sistema ibrido a due componenti per lo SHROOM-Visions Shared Task che combina un modello multimodale per l’etichettatura di sequenze, composto da XLM-RoBERTa-Large integrato con un encoder visivo SigLIP tramite cross-attention, con il nostro VLM generativo sottoposto a fine-tuning (Qwen3.5-4B-SHROOM-SFT). Attraverso una strategia Union-Calibrated Fusion, ai segmenti candidati prodotti dal modello generativo vengono riassegnati punteggi basati sulle probabilità calibrate del modello per l’etichettatura di sequenze. Nella partizione di valutazione in inglese di SHROOM-Visions, il nostro ensemble raggiunge una correlazione di Pearson per la calibrazione di 0,41 e una IoU complessiva di 0,39, con una IoU di 0,91} per le risposte prive di allucinazioni e un’accuratezza complessiva del rilevamento del 70,7%. Rendiamo pubblicamente disponibili i pesi del nostro modello e il codice.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv