Ricerca
Il pre-preaddestramento su dati sintetici resta efficace su larga scala, ma non come prior grammaticale
Il pre-preaddestramento (PPT) su dati sintetici non in lingua naturale migliora l’efficienza nell’uso dei token durante il preaddestramento (PT) dei modelli linguistici. Studi precedenti attribuiscono

- arXiv
- 2609.39827
- Pubblicato
- 2026-09-30
- Autori
- Atsuki Yamaguchi, Tatsuro Inaba, Joel Niklaus, Michal Štefánik, Aline Villavicencio, Nikolaos Aletras
Abstract degli autori
Il pre-preaddestramento (PPT) su dati sintetici non in lingua naturale migliora l’efficienza nell’uso dei token durante il preaddestramento (PT) dei modelli linguistici. Studi precedenti attribuiscono questo vantaggio a un prior grammaticale, cioè a una predisposizione strutturale appresa durante il PPT che si trasferisce alla grammatica della lingua naturale. Tuttavia, il PPT è stato testato solo su modelli con al massimo 1B parametri e con budget di PT inferiori a 2B token, usando prevalentemente testi del web. Non è noto se il PPT sia efficace su scala maggiore e con combinazioni di dati di PT più realistiche, che includano fonti diverse, per esempio codice e matematica. Presentiamo quindi uno studio approfondito sul PPT che comprende cinque compiti di PPT, quattro combinazioni di dati di PT, quattro scale dimensionali dei modelli (da 500M a 7B parametri) e budget di PT fino a 100B token. I nostri risultati mostrano che i miglioramenti nelle prestazioni nei compiti a valle e nell’efficienza nell’uso dei token ottenuti con il PPT persistono su larga scala: per esempio, alla scala di 3B parametri si risparmiano almeno 21B token di PT. Tuttavia, a differenza degli studi precedenti, non troviamo prove coerenti che questi miglioramenti derivino da un prior grammaticale. Le prestazioni nei compiti a valle non corrispondono in modo coerente all’accettabilità grammaticale alle diverse dimensioni dei modelli. Troviamo invece che i miglioramenti nei compiti a valle derivano da compiti di PPT che potenziano il recupero di informazioni a lunga distanza. Infine, i miglioramenti delle prestazioni ottenuti con il PPT sono robusti rispetto alla composizione delle combinazioni di dati di PT e si riducono solo quando mancano i testi del web. Nel complesso, il PPT è un’aggiunta a basso costo al PT e la progettazione dei futuri compiti di PPT dovrebbe puntare sul recupero di informazioni a lunga distanza anziché sulla grammatica della lingua naturale.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv