Vai al contenuto
AI.info

Ricerca

Sapere quando non riutilizzare: trasferimento condizionato dell’esperienza nel post-training autonomo dei modelli linguistici di grandi dimensioni

I modelli linguistici di grandi dimensioni offrono ampie capacità, ma adattarli a domini, strumenti e requisiti in evoluzione richiede spesso ripetute fasi di post-training. I sistemi autonomi automat

Sapere quando non riutilizzare: trasferimento condizionato dell’esperienza nel post-training autonomo dei modelli linguistici di grandi dimensioni
arXiv
2608.26730
Pubblicato
2026-08-27
Autori
Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu Wuerkaixi, Guohua Liu, Yuewei Zhang

Abstract degli autori

I modelli linguistici di grandi dimensioni offrono ampie capacità, ma adattarli a domini, strumenti e requisiti in evoluzione richiede spesso ripetute fasi di post-training. I sistemi autonomi automatizzano parte di questo processo proponendo aggiornamenti, sottoponendo i candidati a training e usando i risultati delle valutazioni per scegliere le proposte successive. Man mano che si accumulano evidenze, emerge un problema centrale: quali evidenze relative agli aggiornamenti passati restano utilizzabili dopo che un ulteriore training ha modificato il modello genitore? L’effetto di un aggiornamento dipende dal modello genitore, dai dati e dalla fase del training. Considerare un successo passato come un’autorizzazione valida indipendentemente dal contesto può sprecare risorse di calcolo. Se il modello figlio risultante viene promosso, può anche peggiorare la traiettoria del training successivo. Formuliamo questo problema come trasferimento condizionato dell’esperienza e presentiamo Boundary-Calibrated Intervention Transfer (BCIT), un metodo che autorizza il riutilizzo dell’esperienza prima di un training che modifica i pesi. BCIT collega un effetto osservato al suo contesto di origine, verifica le condizioni di applicabilità, esclude i candidati con conflitti insormontabili esplicitamente identificati e, quando necessario, raccoglie evidenze sullo stato attuale mediante una prova di training limitata. I candidati sottoposti a training completo restano comunque soggetti a una regola di adozione comune, e solo gli eventi osservati ampliano la memoria. Su un modello da 4B adattato al ragionamento in ambito finanziario, al text-to-SQL e al function calling, gli aggiornamenti candidati mostrano effetti eterogenei sull’obiettivo e sulla conservazione nei contesti valutati. A parità di candidati, evidenze e risorse di calcolo, BCIT autorizza meno aggiornamenti dannosi e ottiene una qualità del modello finale superiore, a parità di budget, rispetto alle alternative valutate. Questi risultati indicano che l’autorizzazione al riutilizzo dell’esperienza va trattata come un problema distinto nel post-training autonomo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv