Vai al contenuto
AI.info

Ricerca

Per trovare corrispondenze bisogna essere in due: un sistema di recupero generativo coevolutivo con apprendimento per rinforzo

Il recupero è la prima fase dei moderni sistemi di ricerca e pubblicità: seleziona, da un vasto insieme di elementi, un gruppo di candidati per le successive fasi di ordinamento e asta. Studi recenti

Per trovare corrispondenze bisogna essere in due: un sistema di recupero generativo coevolutivo con apprendimento per rinforzo
arXiv
2609.00638
Pubblicato
2026-09-01
Autori
Runpeng Dai, Kaili Huang, Changsung Kang, Ciya Liao

Abstract degli autori

Il recupero è la prima fase dei moderni sistemi di ricerca e pubblicità: seleziona, da un vasto insieme di elementi, un gruppo di candidati per le successive fasi di ordinamento e asta. Studi recenti ricorrono sempre più spesso agli LLM per migliorare il recupero attraverso l’espansione delle query, la sintesi dei dati e l’addestramento basato sul feedback del recupero. Tuttavia, la componente generativa viene in genere usata per arricchire le query, mentre la corrispondenza finale resta affidata a un sistema di recupero a valle. Presentiamo CoGR, un framework di recupero che addestra invece gli LLM a costruire direttamente rappresentazioni per il recupero sia sul lato delle query sia su quello degli elementi. Ciascun generatore produce un insieme compatto di parole chiave, che vengono abbinate direttamente tramite un indice invertito, mantenendo la compatibilità con le infrastrutture di recupero basate su parole chiave già esistenti. CoGR impiega una procedura di addestramento in due fasi. Il fine-tuning supervisionato definisce dapprima uno spazio condiviso di parole chiave; successivamente, l’apprendimento per rinforzo coevolutivo ottimizza a turno con GRPO i generatori lato query e lato elemento rispetto all’indice congelato del lato opposto. Entrambi i lati ottimizzano lo stesso obiettivo $F_1$ per il recupero dalla query all’elemento: il lato query riceve direttamente il valore $F_1$ del recupero, mentre il lato elemento riceve una ricompensa marginale controfattuale che misura la variazione del valore $F_1$ sul lato query causata dalle parole chiave che ha generato. Nel confronto con 10 baseline rappresentative di approcci sparsi, densi e generativi, CoGR ottiene le migliori prestazioni sia su un dataset interno di APP Marketplace sia sul benchmark pubblico WANDS, migliorando il valore $F_1$ rispetto alla baseline più forte rispettivamente del $10.9\%$ e del $36.1\%$. Ulteriori analisi mostrano una coevoluzione stabile e spazi di parole chiave delle query e degli elementi sempre più allineati nel corso dell’addestramento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv