Ricerca
Aumentare la scala e distillare gli embedding testuali per migliorarne la diffusibilità
I modelli linguistici a diffusione (DLM) offrono un’alternativa promettente alla generazione autoregressiva (AR) del linguaggio. I recenti progressi nei DLM continui, che applicano la diffusione laten

- arXiv
- 2610.01016
- Pubblicato
- 2026-10-01
- Autori
- Zekai Zhang, Yunjie Tian, Yanjin He, Xiaoyan Zhang, Dongdi Zhao, Qing Qu, Di Fu
Abstract degli autori
I modelli linguistici a diffusione (DLM) offrono un’alternativa promettente alla generazione autoregressiva (AR) del linguaggio. I recenti progressi nei DLM continui, che applicano la diffusione latente a embedding testuali continui, sollevano una questione pratica: quali embedding producono lo spazio latente migliore, ossia il più diffusibile? Per rispondere, esaminiamo diversi embedding e scopriamo che passare a modelli di embedding più potenti della stessa famiglia (da T5 a T5Gemma-1 a T5Gemma-2) migliora notevolmente le prestazioni generative. Gli embedding grezzi di T5Gemma-2, però, non sono ancora ottimali. Sono così discriminativi che persino gli embedding di parole alternative plausibili risultano separati tra loro, rendendo la generazione vulnerabile a un campionamento imperfetto. Di conseguenza, la diffusione continua spesso non riesce a raggiungere nessuno di essi e finisce invece su un embedding non valido. Per affrontare il problema, distilliamo T5Gemma-2 in un encoder studente che apprende le probabilità decodificate del modello insegnante come etichette soft. L’apprendimento da queste etichette porta lo studente ad avvicinare gli embedding alternativi, preservando al contempo il meccanismo di codifica e decodifica. Gli embedding distillati formano uno spazio latente più connesso e diffusibile, migliorando i risultati ottenuti con gli embedding T5Gemma-2 non distillati. Di conseguenza, il nostro DLM di medie dimensioni raggiunge una Gen. PPL di 17,8 (contro una PPL del testo reale di 15,4) a parità di entropia del testo reale su OpenWebText, superando GPT-2-M in termini di Gen. PPL.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv