Ricerca
Embedding generativi a interazione tardiva per il recupero di documenti visivi
Il recupero a interazione tardiva rappresenta lo stato dell’arte nella ricerca di documenti visivi, ma la sua accuratezza ha un costo in termini di spazio di archiviazione. I metodi di compressione es

- arXiv
- 2609.11808
- Pubblicato
- 2026-09-10
- Autori
- Mohamed Eltahir, Talal Aloushan, Rose Khairoalsendi, Jana Shata, Mohammed Alhassan, Leen Alrehaili, Tanveer Hussain, Naeemullah Khan
Abstract degli autori
Il recupero a interazione tardiva rappresenta lo stato dell’arte nella ricerca di documenti visivi, ma la sua accuratezza ha un costo in termini di spazio di archiviazione. I metodi di compressione esistenti conservano un sottoinsieme dei N~1.000 vettori per pagina, oppure ne calcolano medie locali. Quando lo spazio disponibile è molto limitato, però, le loro prestazioni peggiorano nettamente, mentre le alternative richiedono di riaddestrare l’encoder. Analizzando questo peggioramento su tre encoder, abbiamo riscontrato due proprietà ricorrenti: i vettori giacciono esattamente sulla sfera unitaria e si concentrano vicino a una varietà di dimensione intrinseca compresa tra cinque e sei. Questa geometria porta a due osservazioni. La prima è che i centroidi k-means standard cadono all’interno della sfera, causando una sottostima sistematica dei punteggi MaxSim. Normalizzarli sulla superficie è una correzione a costo zero che vale fino a +0,093 nDCG@5 rispetto ai centroidi non normalizzati. La seconda è che, poiché la varietà della pagina ha pochi gradi di libertà, l’insieme completo dei vettori può essere rigenerato a partire da pochi di essi. A questo scopo presentiamo Generative Late-Interaction Embeddings (GLIE): k << N vettori per pagina, appresi a partire dai centroidi normalizzati, che fungono sia da indice leggero sia da base per rigenerare l’insieme completo degli embedding della pagina. Al momento della query, la ricerca avviene esclusivamente su questi k vettori; un decoder riespande soltanto i candidati ai primi posti fino a ricostruire tutti gli N vettori, per ricalcolarne esattamente i punteggi. Con quattro vettori per pagina su ViDoRe v1, GLIE conserva quasi l’80% dell’nDCG@5 del sistema non compresso, contro il 70% del miglior metodo precedente applicabile a posteriori. Questi risultati sono ottenuti con una rete da 415K parametri addestrata in meno di tre minuti di GPU su appena mille pagine di addestramento. A parità di budget di addestramento, il fine-tuning dell’encoder non raggiunge nemmeno le prestazioni della fase di GLIE che non richiede addestramento, e il sistema completo lo supera con qualsiasi budget. Questi andamenti si confermano con un secondo encoder e su ViDoRe v2. Ricostruendo le informazioni necessarie su richiesta anziché campionarle, GLIE apre una nuova strada per il recupero efficiente nell’uso dello spazio di archiviazione, in cui il decoder è il principale elemento su cui intervenire nella progettazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv