Ricerca
Segui le entità: una mappa del corpus per la ricerca agentica
Rispondere a domande e svolgere compiti su grandi raccolte di documenti richiede spesso di collegare informazioni sparse in più documenti: per esempio, l’approvazione di un progetto registrata in uno,

- arXiv
- 2609.37226
- Pubblicato
- 2026-09-29
- Autori
- Soyeong Jeong, Sujay Kumar Jauhar, Sung Ju Hwang, Andrew Joohun Nam
Abstract degli autori
Rispondere a domande e svolgere compiti su grandi raccolte di documenti richiede spesso di collegare informazioni sparse in più documenti: per esempio, l’approvazione di un progetto registrata in uno, i suoi requisiti in un altro e il suo stato più recente in un terzo. I recenti agenti basati su LLM affrontano questo problema cercando in modo iterativo nell’intero corpus, anziché leggere soltanto un insieme fisso dei documenti meglio classificati. Tuttavia, quando il corpus è presentato solo come una raccolta indistinta di file, un documento pertinente non indica in che modo sia collegato agli altri. L’agente deve quindi riscoprire queste relazioni per ogni richiesta, spesso perdendo informazioni complementari e consumando al tempo stesso molti token aggiuntivi. Per affrontare il problema, presentiamo CorpusMap, un livello di navigazione che organizza il corpus attorno alle entità ricorrenti, identificabili nei documenti stessi e capaci di collegare un singolo documento a molti altri provenienti da fonti diverse. In particolare, CorpusMap rappresenta ogni entità ricorrente con una Entity Page, che raccoglie le informazioni sull’entità e rimanda a tutti i documenti che la menzionano. Si forma così un grafo di entità e documenti che l’agente può percorrere per raccogliere informazioni altrimenti scollegate. Inoltre, poiché CorpusMap viene costruito offline risolvendo i riferimenti alla stessa entità presenti in documenti diversi, i suoi collegamenti sono condivisi tra le richieste, anziché essere riscoperti ogni volta in fase di inferenza. Usando 7 modelli diversi con 3 dataset benchmark, mostriamo che CorpusMap migliora sia l’individuazione delle informazioni sia la qualità delle risposte rispetto alla ricerca agentica nel corpus grezzo, usando in media meno token. Supera inoltre 4 livelli di navigazione alternativi, suggerendo che le entità siano punti di riferimento efficaci per navigare in grandi raccolte di documenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv