The Pulse
R4T di Google trasforma l’apprendimento per rinforzo in un recupero più rapido
Google Research ha presentato Retrieve-for-Train, un sistema che usa l’apprendimento per rinforzo durante l’addestramento e un modello di diffusione per recuperare più risultati più rapidamente. Il retriever, con 53,9 milioni di parametri,

AI.info Team ·
Google sposta la sfida del recupero dall’inferenza all’addestramento
I modelli linguistici di grandi dimensioni possono scomporre una richiesta ampia in diverse ricerche, ma questo metodo comporta un compromesso diretto: generare più direzioni di ricerca utili migliora la copertura, mentre la generazione sequenziale del testo aumenta la latenza. Google Research afferma che il suo nuovo sistema Retrieve-for-Train, o R4T, risolve questo conflitto usando l’apprendimento per rinforzo una sola volta durante l’addestramento, per poi affidare il recupero a un modello di diffusione più piccolo al momento della richiesta.
Google ha presentato il framework il 15 settembre 2026, insieme al suo articolo, «Recupero a ventaglio efficiente e allineato alle proprietà tramite diffusione compilata con RL». Il metodo è pensato per le ricerche in cui la risposta è un insieme, anziché un singolo documento: una raccolta coerente di attrezzatura da campeggio, un gruppo di capi d’abbigliamento compatibili o una playlist con diversi temi correlati.
R4T è progettato per prevenire due errori comuni nella scomposizione delle query in più ricerche. I modelli linguistici generici spesso producono riformulazioni quasi identiche della stessa richiesta, mentre i modelli addestrati per massimizzare i premi di recupero possono sfruttare il sistema di valutazione generando risultati privi di senso o troppo circoscritti. L’approccio di Google aggiunge premi separati per l’aderenza al database, la diversità semantica e l’allineamento con la query originale.
R4T usa l’RL per convertire l’obiettivo
Il framework separa la fase di scoperta da quella di utilizzo in tre passaggi. Per prima cosa, un modello linguistico che genera query a ventaglio produce diverse sottoquery e riceve un premio basato sull’insieme dei risultati recuperati da queste query. In secondo luogo, il modello addestrato genera esempi sintetici di query e risultati attesi. Infine, Google addestra un retriever a diffusione per associare direttamente l’embedding di una query a una raccolta di embedding di risultati attesi.
Questa architettura evita di inserire la policy di apprendimento per rinforzo nel percorso critico di ogni richiesta degli utenti. L’articolo descrive due varianti per l’utilizzo: R4T-FOLM, che esegue direttamente il modello linguistico addestrato con i premi, e R4T-Diffusion, che ne distilla il comportamento in un modello non autoregressivo che campiona direzioni di recupero nello spazio degli embedding.
R4T-Diffusion non genera normali sottoquery testuali prima di effettuare la ricerca. Produce diversi embedding in parallelo e li associa agli elementi del database tramite il recupero dei vicini più prossimi. Il blog di Google descrive il modello di diffusione utilizzato come dotato di 53,9 milioni di parametri, mentre l’articolo afferma che, negli esperimenti riportati, ciascun metodo genera 10 direzioni di recupero.
Google segnala una latenza da 12 a 20 volte inferiore
Il test di efficienza di Google confronta il retriever a diffusione con la generazione a ventaglio basata su modelli linguistici autoregressivi, usando batch di dimensioni crescenti. Con un batch di dimensione otto, il sistema autoregressivo impiega circa 1,46 secondi, contro gli 0,07 secondi del modello di diffusione. Con un batch di dimensione 1.024, i tempi misurati arrivano a quasi 50 secondi per il sistema autoregressivo e a 4,21 secondi per la diffusione.
In questi test, l’articolo riporta un’accelerazione costante da 12 a 20 volte. Google attribuisce la differenza alla generazione parallela: il modello di diffusione crea l’intero insieme di direzioni di recupero in un solo passaggio in avanti, mentre i sistemi basati su modelli linguistici generano le sottoquery in sequenza e attivano ripetutamente il recupero.
La latenza ridotta ha un costo. Il sistema a diffusione dipende da una pipeline di addestramento che, per prima cosa, impara come dovrebbe essere un insieme di risultati di alta qualità. Le sue prestazioni dipendono anche dal modello di embedding e dal database usato per definire lo spazio di recupero; i numeri riportati descrivono quindi una configurazione addestrata e specifica per un dominio, non un sostituto universale della ricerca web generica.
I test su moda e musica mettono in luce il compromesso sulla qualità
Google valuta R4T in due contesti di recupero. Open-Ended Abstract Retrieval misura diversità, allineamento e aderenza ai dati quando non esiste un unico insieme di risultati corretto. Weakly Supervised Compositional Retrieval usa un insieme di riferimento come una possibile interpretazione di una query e verifica quanto bene il sistema recupera elementi correlati senza considerare esaustivo quell’insieme.
Gli esperimenti usano Polyvore, un benchmark di moda che contiene outfit selezionati dagli utenti, e un dataset musicale proprietario composto da playlist create da esperti. Per il compito di recupero astratto, Polyvore include insiemi candidati di 21.888 raccolte; per il compito composizionale, ne include 142.472 elementi. L’esperimento musicale usa 8.522 embedding di playlist.
I risultati mostrano una chiara differenza tra le due varianti di R4T. Nel compito composizionale di Polyvore, R4T-FOLM con Qwen3-4B registra un Recall@5K di 20,9 e un Hit@5K di 64,6, mentre R4T-Diffusion con lo stesso modello di base registra rispettivamente 16,5 e 57,5. La versione a diffusione ottiene però un punteggio di diversità Vendi più alto, pari a 34,7 contro 27,5 per R4T-FOLM: ciò indica che i suoi insiemi di risultati coprono una gamma più ampia di interpretazioni.
Google presenta questa differenza come un compromesso pratico, non come un difetto. Un modello linguistico può ottimizzare più direttamente la sovrapposizione con un insieme di riferimento debole, mentre la diffusione conserva una maggiore varietà campionando diverse possibili direzioni di recupero. Poiché gli insiemi di riferimento rappresentano una possibile risposta, non tutte le risposte valide, una sovrapposizione inferiore non significa automaticamente che il recupero sia peggiore.
La funzione di ricompensa è anche il rischio
La principale tesi tecnica di R4T è che l’apprendimento per rinforzo possa creare dati di supervisione utili quando scarseggiano dati etichettati con cura a livello di insieme. Il sistema non valuta ogni risultato singolarmente: valuta la raccolta nel suo complesso, consentendo all’obiettivo di addestramento di includere proprietà come la complementarità e l’ampiezza semantica.
Anche i risultati delle ablazioni di Google mostrano perché sia necessario combinare questi premi. Quando si rimuove la diversità, il modello che genera le query a ventaglio può produrre stringhe malformate che per caso raggiungono posizioni favorevoli nello spazio degli embedding. L’allineamento riduce questo problema, ma può incoraggiare parafrasi ripetitive. Il Vendi Score funge da contrappeso, premiando una copertura più ampia nell’insieme generato.
Questa dipendenza dalla progettazione dei premi limita la possibilità di generalizzare i risultati. L’articolo avverte che premi scelti male possono riprodurre o amplificare i pregiudizi presenti nei dati di partenza, soprattutto se il metodo viene applicato alla raccomandazione, alla scoperta di contenuti o ad altri contesti in cui l’insieme recuperato influenza le scelte delle persone.
L’obiettivo immediato di R4T è il recupero specializzato
Google propone Retrieve-for-Train per i sistemi di raccomandazione, la ricerca creativa e l’esplorazione di raccolte specializzate, non come sostituto di ogni architettura di ricerca. Il framework è più utile quando un sistema deve restituire un insieme coerente di risultati, il database ha uno spazio di embedding fisso e produrre esempi etichettati da persone per il comportamento desiderato a livello di insieme è costoso.
La sua principale scelta ingegneristica è semplice: sostenere il costo computazionale più elevato prima della messa in produzione, usare l’apprendimento per rinforzo per individuare un comportamento allineato ai premi e comprimerlo in un modello più piccolo, capace di rispondere in parallelo. Nel benchmark riportato da Google, questo approccio ha prodotto un retriever con 53,9 milioni di parametri, riducendo il tempo per un batch di 1.024 elementi generati a ventaglio da quasi 50 secondi a 4,21 secondi.