Vai al contenuto
AI.info

Ricerca

False frontiere: individuare e mitigare il co-cheating negli agenti di ricerca autoevolutivi

Gli agenti di ricerca autoevolutivi costruiscono i propri percorsi di addestramento ottimizzando congiuntamente un generatore di domande e un risolutore che risponde. Questo ciclo chiuso introduce un

False frontiere: individuare e mitigare il co-cheating negli agenti di ricerca autoevolutivi
arXiv
2609.39102
Pubblicato
2026-09-30
Autori
Meijia Chen, Hao Li, Zheng Lu, Hongshan Lin, Junbai Tian, Yichen Liu, Zijun Tian, Yufan Zou, Shuhan Sun, Hanxin Chen, Zeyu Zhang, Weizhi Du, Yueting Li, Tianyu Shi, Alaa Khamis

Abstract degli autori

Gli agenti di ricerca autoevolutivi costruiscono i propri percorsi di addestramento ottimizzando congiuntamente un generatore di domande e un risolutore che risponde. Questo ciclo chiuso introduce un problema che chiamiamo co-cheating: il generatore e il risolutore concordano sempre più spesso su errori condivisi, così la ricompensa interna migliora senza un corrispondente aumento della correttezza misurata all’esterno. Una verifica successiva sulla base delle fonti mostra che il co-cheating si aggrava nei successivi cicli di autoevoluzione: la correttezza delle pseudoetichette ristagna o diminuisce anche mentre migliora il segnale di addestramento interno al ciclo. La misura più diretta è verificare i quesiti proposti prima dell’addestramento: introduciamo la verifica a campionamento multiplo (MSV), che interroga lo stesso modello tre volte con la fonte e tre volte senza, per decidere se ammettere un quesito e sostituire le pseudoetichette inaffidabili. MSV riduce in parte gli accordi erronei, ma lascia un co-cheating residuo considerevole e richiede sei generazioni aggiuntive del modello che assegna le etichette per ogni quesito candidato. Questi limiti motivano CrossFit, il nostro metodo principale: suddivide i documenti fonte del generatore in due gruppi, A e B; le domande generate a partire da A vengono valutate da un risolutore ausiliario addestrato solo su B, e viceversa. L’accordo ottenuto con questo addestramento incrociato determina la ricompensa del generatore: una pseudoetichetta ricavata dalla stessa fonte non può quindi essere riprodotta tramite il risolutore usato per il feedback, mentre la regola di aggiornamento del risolutore originale resta invariata. Ripetendo il ciclo con Qwen3.5-4B e Qwen3.5-9B, MSV riduce la quota di accordi erronei dal 6,1% al 5,7% e dall’8,8% al 7,2%, mentre CrossFit la riduce al 3,0% e al 3,7%. Riproporre quesiti identici con un feedback che esclude la fonte riduce ulteriormente gli accordi erronei allo 0,4% e allo 0,1%, isolando l’effetto della provenienza del feedback da quello dei cambiamenti nel percorso di addestramento. Su sette benchmark successivi di ricerca, CrossFit migliora le prestazioni medie rispetto alla normale autoevoluzione accoppiata di 8,8 e 8,4 punti e rispetto a Search-R1 di 8,7 e 7,8 punti, rispettivamente con i modelli 4B e 9B.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv