Vai al contenuto
AI.info

Ricerca

Hi-Q: raffinamento gerarchico delle query guidato dalle evidenze per la risposta a domande a più passaggi

Uno dei principali ostacoli nella risposta a domande a più passaggi (QA) è che la granularità con cui viene formulata una domanda spesso differisce da quella con cui è possibile recuperare le evidenze

Hi-Q: raffinamento gerarchico delle query guidato dalle evidenze per la risposta a domande a più passaggi
arXiv
2608.30468
Pubblicato
2026-08-31
Autori
Jueun Kim, Sungho Park, Wook-Shin Han

Abstract degli autori

Uno dei principali ostacoli nella risposta a domande a più passaggi (QA) è che la granularità con cui viene formulata una domanda spesso differisce da quella con cui è possibile recuperare le evidenze dal corpus. I metodi esistenti affrontano questa discrepanza imponendo al corpus strutture a grafo fisse, riformulando iterativamente la query o eseguendo sul corpus un programma generato. Queste strategie, però, non stabiliscono esplicitamente quando un’unità della query è già supportata dalle evidenze e quando deve essere raffinata. Formuliamo questo problema come individuazione della granularità recuperabile e presentiamo Hi-Q, un framework per il raffinamento gerarchico delle query condizionato dalle evidenze. A ogni nodo della query, un operatore di risoluzione verifica se le evidenze recuperate supportano l’unità corrente: i nodi risolti si fermano, mentre quelli irrisolti vengono espansi da un operatore binario che preserva le dipendenze e controllati da un verificatore della copertura semantica. Hi-Q costruisce così un albero delle query la cui topologia è determinata dai segnali di supporto del corpus, anziché da uno schema di scomposizione fisso o da un grafo precostruito. Valutiamo Hi-Q su tre benchmark di QA a più passaggi, principalmente con il recupero sull’intero corpus, dove le evidenze dipendenti devono essere individuate tra elementi di disturbo in dominio aperto, anziché all’interno di un piccolo insieme annotato. In questo scenario, Hi-Q raggiunge in media sui tre benchmark 52,3 EM e 64,0 F1, superando la baseline di recupero iterativo IRCoT di 15,1 EM / 18,2 F1 sulla stessa media e la baseline RAG basata su grafi PropRAG di 11,5 EM / 12,0 F1 su MuSiQue-full, senza costruire un grafo per l’intero corpus. Anche nello scenario ristretto con evidenze di supporto ed elementi di disturbo usato nei lavori precedenti, Hi-Q ottiene la migliore accuratezza, con una media di 57,9 EM e 69,3 F1: supera PropRAG di 5,6 EM / 3,9 F1 e IRCoT di 13,7 EM / 15,8 F1. La pagina del progetto è disponibile all’indirizzo https://hi-q-project.github.io/.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv