Ricerca
Modelli linguistici gerarchici a diffusione continua
I modelli linguistici a diffusione discreta offrono un’alternativa interessante alla generazione autoregressiva per i compiti che richiedono ragionamento bidirezionale e rispetto di vincoli globali. P

- arXiv
- 2610.02193
- Pubblicato
- 2026-10-01
- Autori
- Hui Ren, Zihan Li, Chang Liu, Huidong Liu, Alexander Schwing
Abstract degli autori
I modelli linguistici a diffusione discreta offrono un’alternativa interessante alla generazione autoregressiva per i compiti che richiedono ragionamento bidirezionale e rispetto di vincoli globali. Presentano però un limite strutturale: quando la decodifica avviene in parallelo, ogni token viene campionato indipendentemente dalla propria distribuzione marginale, interrompendo le dipendenze statistiche tra i token decodificati insieme. I modelli linguistici a diffusione continua evitano questo problema rimuovendo il rumore da uno stato continuo condiviso, ma il loro modello di denoising vede soltanto quello stato: fino alla decodifica finale, quindi, nulla lo vincola a una configurazione valida di token. Per affrontare il problema, proponiamo Hierarchical Continuous Diffusion Language Models (HC-DLM), che combinano la generazione di token discreti con una traiettoria latente continua in un unico processo di denoising fondato su principi teorici, il cui obiettivo di addestramento deriva da un limite variazionale sulla verosimiglianza dei token. A differenza dei metodi recenti che aggiungono un contesto continuo a una catena discreta autonoma, HC-DLM fa della rappresentazione latente l’unico stato generativo persistente: i token vengono ricavati da essa a ogni passaggio e riutilizzati come struttura di supporto per il successivo aggiornamento dello stato latente. Nei compiti di ragionamento strutturato (Sudoku), pianificazione matematica (Countdown) e modellazione del linguaggio (LM1B), HC-DLM supera i modelli di riferimento a diffusione discreta e continua a parità di dimensioni del modello, sia nell’accuratezza nella risoluzione dei rompicapi Sudoku e Countdown sia nella perplessità generativa su LM1B. Pagina del progetto: https://hc-dlm.github.io/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv