Vai al contenuto
AI.info

Ricerca

DiagEvo: autoevoluzione guidata dalla diagnosi tramite una memoria gerarchica degli errori

Il self-play è un paradigma efficace per l’autoevoluzione dei modelli linguistici, ma senza una guida le prestazioni del modello risolutore possono stabilizzarsi o peggiorare da un ciclo all’altro. I

DiagEvo: autoevoluzione guidata dalla diagnosi tramite una memoria gerarchica degli errori
arXiv
2609.00768
Pubblicato
2026-09-01
Autori
Xincheng Wei, Yifan Ding, Yoshua Li, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Wenjian Ding, Yao Zhang

Abstract degli autori

Il self-play è un paradigma efficace per l’autoevoluzione dei modelli linguistici, ma senza una guida le prestazioni del modello risolutore possono stabilizzarsi o peggiorare da un ciclo all’altro. I metodi non guidati orientano la generazione delle domande con segnali come la difficoltà, la facilità di apprendimento o la diversità. Questi segnali mantengono le domande impegnative e varie, ma non indicano quali debolezze di ragionamento ancora irrisolte debbano essere affrontate nei cicli successivi. I metodi guidati traggono invece indicazioni da risorse esterne relative al compito, tra cui esempi umani, raccolte di documenti o obiettivi di difficoltà specificati, e dipendono quindi da informazioni sul compito fornite al di fuori del ciclo di self-play. Mostriamo che le indicazioni necessarie possono invece essere ricavate dalla storia degli errori del modello risolutore. Presentiamo DiagEvo, il cui modulo diagnostico estrae da questa storia le cause ricorrenti degli errori e le conserva in una memoria gerarchica delle cause degli errori. La memoria raggruppa le cause correlate sotto nodi che rappresentano competenze e classifica ciascuna causa come Attiva o Padroneggiata in base all’autoconsistenza sulle domande mirate. Il modulo che genera le sfide usa questi stati e il numero di ricorrenze per bilanciare la generazione mirata alle cause con la libera esplorazione. Un filtro a doppia confidenza conserva le domande di difficoltà intermedia solo quando la risposta più frequente del modello risolutore ha un netto vantaggio nel numero di voti. DiagEvo ricava il proprio percorso di apprendimento dalle informazioni prodotte durante il self-play, senza risorse esterne relative al compito. Con il modulo diagnostico 4B predefinito, DiagEvo supera tutti i metodi di confronto per accuratezza media sull’insieme dei nove benchmark, per ciascuno dei tre modelli risolutori: Qwen3-4B, Qwen3-8B e OctoThinker-8B. Con Qwen3-8B raggiunge un’accuratezza media del 72,3% su cinque benchmark di ragionamento matematico, 4,5 punti percentuali sopra R-Zero. La sua accuratezza media sull’insieme dei nove benchmark è del 57,4%, 1,1 punti percentuali sopra DARC. Gli esperimenti di ablazione mostrano che sia la memoria gerarchica delle cause degli errori sia il filtro a doppia confidenza contribuiscono a questi miglioramenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv