Ricerca
RenderRank: imparare a riordinare i testi per pertinenza con token visivi compressi
Rappresentare il testo dei documenti come immagini consente ai modelli visione-linguaggio di codificarli come token visivi, riducendo potenzialmente la lunghezza della sequenza di input rispetto al te

- arXiv
- 2609.35069
- Pubblicato
- 2026-09-28
- Autori
- Seongtae Hong, Youngjoon Jang, Jungseob Lee, Hyeonseok Moon, Heuiseok Lim
Abstract degli autori
Rappresentare il testo dei documenti come immagini consente ai modelli visione-linguaggio di codificarli come token visivi, riducendo potenzialmente la lunghezza della sequenza di input rispetto al testo. Questa riduzione è particolarmente utile nel riordinamento per pertinenza, in cui per ogni query occorre assegnare un punteggio a più documenti candidati e il risparmio di token si applica alla valutazione di ciascuno. Presentiamo RenderRank, un reranker che apprende ad assegnare punteggi di pertinenza in funzione della query a partire da rappresentazioni visive compresse dei documenti, anziché dalle sequenze di token testuali usate dai reranker convenzionali basati sul testo. L’addestramento allinea dapprima i punteggi di pertinenza ottenuti dagli input visivi a quelli di un modello teacher basato sul testo, poi affina i punteggi relativi dei documenti positivi e negativi per la stessa query. Su 11 dataset di BEIR, RenderRank usa dal 16,5 al 35,5% di token di input in meno e raggiunge un NDCG@10 medio di 55,96, superando tutti i modelli di riferimento basati sul testo valutati con meno di 4 miliardi di parametri e alcuni modelli più grandi. Su quattro dataset di documenti lunghi raggiunge un NDCG@10 medio di 88,27, con un numero medio di token di input pari a circa la metà di quello dei reranker basati sul testo valutati. In questo contesto, RenderRank raggiunge una capacità di elaborazione pari a 1,70 volte la più alta capacità media registrata dai modelli di riferimento valutati. Questi risultati mostrano che le rappresentazioni visive compresse possono consentire di assegnare punteggi accurati alla pertinenza dei documenti, offrendo un’alternativa alle rappresentazioni basate su token testuali per il riordinamento per pertinenza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv