Ricerca
AdaTutoRank: imparare a riordinare insiemi di documenti tramite Adaptive Tutoring Optimization per RAG e la ricerca approfondita
I reranker di documenti determinano quali evidenze arrivano al modello a valle nei sistemi RAG e nella ricerca approfondita. I reranker più diffusi, però, selezionano i documenti in base alla corrispo

- arXiv
- 2609.32472
- Pubblicato
- 2026-09-26
- Autori
- Kailin Jiang, Lei Liu, Jian Xi, Yangqi Chen, Hui Xu, Hongwei Zhao, Bin Li, Yu Lu, Haibo Shi
Abstract degli autori
I reranker di documenti determinano quali evidenze arrivano al modello a valle nei sistemi RAG e nella ricerca approfondita. I reranker più diffusi, però, selezionano i documenti in base alla corrispondenza di pertinenza, e documenti singolarmente pertinenti raramente formano l’insieme completo, complementare e non ridondante richiesto da un’esigenza informativa complessa. I lavori precedenti premiano un insieme in base al suo punteggio aggregato secondo una rubrica di valutazione, spostando l’obiettivo dal riordinamento dei documenti alla composizione degli insiemi. Quel punteggio, tuttavia, è un unico valore condiviso da tutti i documenti dell’insieme: un documento ridondante viene premiato insieme agli altri quando l’insieme ottiene un punteggio alto, mentre uno decisivo viene penalizzato insieme agli altri quando non lo ottiene. Nell’attribuzione del merito, chi contribuisce resta indistinguibile da chi non contribuisce. La distillazione on-policy potrebbe rendere più densa questa supervisione, ma i metodi esistenti forniscono a ogni rollout le stesse indicazioni fisse, troppo prescrittive per i rollout migliori e troppo astratte per quelli più deboli. Proponiamo quindi AdaTutoRank, un reranker che opera su insiemi, addestrato con Adaptive Tutoring Optimization (ATO) secondo una gerarchia a tre livelli di nove dimensioni di valutazione. Questa fornisce etichette silver per il cold start, ricompense per l’apprendimento per rinforzo e suggerimenti per la distillazione. ATO ricava tre forme di suggerimento, via via più specifiche, da uno snapshot congelato della policy stessa: le sole rubriche di valutazione, un insieme di pari livello scelto da un autoselettore in base a tali rubriche e la riflessione di un autoriflessore che mette a confronto il rollout con quell’insieme di pari livello. Ogni rollout riceve la forma adatta alla propria qualità. Ricalcolando il punteggio del rollout con il modello insegnante congelato condizionato dal suggerimento e con lo snapshot privo di suggerimenti, l’effetto del suggerimento viene distillato in un vantaggio a livello di token che integra il vantaggio basato sul risultato relativo al gruppo. Su dieci benchmark che coprono RAG, ricerca approfondita e valutazione di insiemi, AdaTutoRank ottiene le migliori prestazioni complessive effettuando meno chiamate di recupero.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv