Vai al contenuto
AI.info

Ricerca

InternReviewer & InternAdvocate: ricompensa e valutazione oggettive per l’apprendimento per rinforzo agentico nella revisione tra pari e nelle repliche

Produrre contenuti accademici di livello professionale, come revisioni tra pari e repliche, richiede una complessa sinergia tra ragionamento specialistico e fondamento fattuale. Questo lavoro presenta

InternReviewer & InternAdvocate: ricompensa e valutazione oggettive per l’apprendimento per rinforzo agentico nella revisione tra pari e nelle repliche
arXiv
2608.28612
Pubblicato
2026-07-21
Autori
Xuerui Su, Liya Guo, Qizhi Pei, Qipeng Guo, Zhongbo Tian, Lijun Wu, Kai Chen, Zun Wang

Abstract degli autori

Produrre contenuti accademici di livello professionale, come revisioni tra pari e repliche, richiede una complessa sinergia tra ragionamento specialistico e fondamento fattuale. Questo lavoro presenta un quadro completo per lo sviluppo e la valutazione di agenti accademici specializzati, InternReviewer e InternAdvocate. Per prima cosa, creiamo un dataset accademico di alta qualità e su larga scala e integriamo uno strumento ad alta efficienza per la ricerca su arXiv, così da consentire la raccolta attiva di riscontri. Per ottimizzare questi agenti, adottiamo un paradigma di apprendimento per rinforzo (RL) agentico basato su una metrica oggettiva e un sistema di ricompense unificati. Il sistema evita le distorsioni delle valutazioni soggettive basate su modelli impiegando criteri multidimensionali, tra cui l’allineamento semantico ancorato ai riferimenti, il rispetto della struttura e un rigoroso meccanismo di verifica che confronta le citazioni con i registri delle interazioni in tempo reale per eliminare le allucinazioni. I risultati sperimentali mostrano che gli agenti addestrati in questo quadro a ciclo chiuso migliorano significativamente nella profondità del ragionamento e nell’accuratezza delle citazioni.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv