Ricerca
CritICL: generalizzazione dai modelli deboli a quelli forti in fase di inferenza a partire dalle modalità di errore dei piccoli modelli linguistici
I recenti progressi nello scaling in fase di inferenza hanno migliorato significativamente le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM). Tuttavia, questi metodi si ba

- arXiv
- 2608.27455
- Pubblicato
- 2026-08-27
- Autori
- Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu
Abstract degli autori
I recenti progressi nello scaling in fase di inferenza hanno migliorato significativamente le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM). Tuttavia, questi metodi si basano in genere sulla generazione ripetuta o su una verifica esterna. Per superare questo limite, presentiamo CritICL, un nuovo approccio per la fase di inferenza che migliora il ragionamento mantenendo un’elevata efficienza. L’intuizione alla base del metodo è che, all’interno della stessa famiglia, le modalità di errore degli LLM seguono schemi strutturati tra modelli di dimensioni diverse. Anziché trattare gli errori come risultati indesiderati, CritICL li usa come guida. In particolare, ricaviamo le modalità di errore dai modelli più deboli e le integriamo nell’inferenza mediante esempi in contesto basati su valutazioni critiche. Proponiamo due varianti: CritICL-dynamic, che predice in modo adattivo le modalità di errore specifiche per ciascun input e recupera le valutazioni critiche, e CritICL-static, che usa un profilo globale delle modalità di errore per fornire una guida stabile. I risultati sperimentali mostrano che CritICL supera sistematicamente l’apprendimento in contesto standard e ottiene prestazioni competitive o superiori rispetto ai metodi di scaling in fase di test, richiedendo al contempo un numero di generazioni significativamente inferiore e un costo in token più basso. Codice disponibile all’indirizzo: https://github.com/umwyf/CRITICL
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv