Ricerca
Segmentazione dei documenti pensata per il reperimento (D-RAC): acquisizione universale di documenti aziendali pensata per il reperimento tramite normalizzazione dei PDF e conversione multimodale in Markdown
I sistemi di generazione aumentata dal recupero (RAG) basati su knowledge base aziendali devono acquisire documenti in formati eterogenei — PDF, documenti Word, presentazioni e scansioni — il cui cont

- arXiv
- 2609.24220
- Pubblicato
- 2026-09-21
- Autori
- Uday Allu, Abhivanth Sivaprakash, Pratik Singh, Aman Manocha
Abstract degli autori
I sistemi di generazione aumentata dal recupero (RAG) basati su knowledge base aziendali devono acquisire documenti in formati eterogenei — PDF, documenti Word, presentazioni e scansioni — il cui contenuto è racchiuso in layout visivi complessi, pagine a più colonne e tabelle dense. L’estrazione basata su regole e l’OCR compromettono l’ordine di lettura, appiattiscono le tabelle e perdono la gerarchia dei titoli, mentre il chunking interamente agentico del testo estratto comporta elevati costi in token e il rischio di allucinazioni. Presentiamo Document Retrieval-Aware Chunking (D-RAC), un’estensione del nostro framework Web Retrieval-Aware Chunking (W-RAC) applicabile a formati documentali arbitrari. D-RAC normalizza innanzitutto qualsiasi documento in ingresso convertendolo in PDF, sfruttando il fatto che praticamente ogni formato può essere riprodotto fedelmente e in modo deterministico in PDF. Un unico passaggio di un LLM multimodale converte quindi le pagine renderizzate in Markdown ottimizzato per il recupero — riscrivendo le tabelle come enunciati in prosa autosufficienti e preservando la gerarchia dei titoli — dopodiché il chunking procede esattamente come in W-RAC: analisi deterministica in unità identificabili tramite ID, seguita da una pianificazione leggera dei chunk basata su LLM e operante sugli identificatori anziché sul testo. Durante il chunking il testo sorgente non viene mai rigenerato, preservando i vantaggi di W-RAC in termini di costi, determinismo e osservabilità e consentendo al contempo di usare come input di prima classe qualsiasi formato riproducibile. Sul sottoinsieme PDF del benchmark RAG-Multi-Corpus, composto da 236 documenti e 795 pagine e relativo a cinque settori aziendali, D-RAC converte e suddivide in chunk l’intero corpus in 72 minuti senza errori, producendo 1.748 chunk pronti per il recupero. Rispetto al chunking agentico con LLM di frontiera, D-RAC riduce del 95,7% i token generati nella fase di chunking, abbattendone i costi dal 77,8% (tariffe di GPT-4.1) all’85,6% (tariffe di Gemini 2.5 Pro) e i tempi del 75%. D-RAC scala linearmente fino a documenti di oltre 500 pagine.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv