Vai al contenuto
AI.info

Ricerca

Imparare ad apprendere dal contesto: addestramento sintetico a partire da documenti pubblici modificati

I compiti del mondo reale richiedono spesso ai modelli linguistici di grandi dimensioni (LLM) di apprendere da contesti complessi e specifici del compito, anziché affidarsi alle conoscenze parametrich

Imparare ad apprendere dal contesto: addestramento sintetico a partire da documenti pubblici modificati
arXiv
2609.33642
Pubblicato
2026-09-27
Autori
Haoyi Wu, Yang Xiao, Yusong Sun, Wenyang Hui, Zhaokai Luo, Chengyue Jiang, Mu Chuan

Abstract degli autori

I compiti del mondo reale richiedono spesso ai modelli linguistici di grandi dimensioni (LLM) di apprendere da contesti complessi e specifici del compito, anziché affidarsi alle conoscenze parametriche acquisite nel preaddestramento. Questa capacità resta un punto debole degli LLM, mentre l’annotazione umana di questi contesti è costosa e difficile da estendere su larga scala. I documenti pubblici di alta qualità sono un’alternativa abbondante, ma gran parte del web pubblico è già stata utilizzata durante il preaddestramento: addestrare i modelli su questi documenti senza particolari accorgimenti favorirebbe la memorizzazione anziché l’apprendimento dal contesto. In questo lavoro cerchiamo di utilizzare documenti pubblici di alta qualità sottoposti a piccole modifiche e riscontriamo empiricamente che gli LLM riescono a generare tracce di ragionamento e risposte dipendenti dal contesto, poi utilizzate per addestrare un modello studente. In particolare, realizziamo una pipeline di sintesi che (i) riscrive i documenti di origine per ridurre il rischio di memorizzazione, (ii) genera domande e griglie di valutazione che richiedono di ragionare sul documento, (iii) risponde alle domande usando il documento come contesto e (iv) ammette soltanto campioni che dipendono realmente dal documento. Senza ricorrere ad annotatori umani, la nostra pipeline genera circa 10k campioni da 3,5k documenti e il modello studente risultante migliora notevolmente le prestazioni su CL-bench. Il fine-tuning supervisionato (SFT) porta uno studente Qwen3.6-35B-A3B dal 13,7% al 22,8%; una successiva fase di apprendimento per rinforzo (RL) con ricompensa basata sulle griglie di valutazione raggiunge il 24,6% su CL-bench, un risultato paragonabile a quello di un modello di frontiera con oltre mille miliardi di parametri, Qwen3.8-2.4T (23,9%). Osserviamo inoltre che i miglioramenti si estendono ampiamente alla comprensione di contesti lunghi, alla capacità di seguire le istruzioni e al ragionamento, mentre la generazione di codice e le conoscenze restano sostanzialmente invariate. Ci auguriamo che questo lavoro offra un metodo riproducibile e scalabile per migliorare la capacità degli LLM di apprendere dal contesto e favorire ulteriori ricerche sul ragionamento fondato sul contesto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv