Vai al contenuto
AI.info

Ricerca

Verso un ragionamento efficiente: apprendere scorciatoie causali per i modelli linguistici a diffusione

I modelli linguistici di diffusione (DLM) hanno attirato notevole attenzione per le loro solide capacità di ragionamento. Tuttavia, con un meccanismo di attenzione bidirezionale, i DLM operano in uno

Verso un ragionamento efficiente: apprendere scorciatoie causali per i modelli linguistici a diffusione
arXiv
2609.28272
Pubblicato
2026-09-23
Autori
Dian Jin, Kairong Han, Baohong Li, Xinpeng Dong, Zijing Hu, Nuanqiao Shan, Fei Wu, Kun Kuang

Abstract degli autori

I modelli linguistici di diffusione (DLM) hanno attirato notevole attenzione per le loro solide capacità di ragionamento. Tuttavia, con un meccanismo di attenzione bidirezionale, i DLM operano in uno spazio di esplorazione esponenzialmente più ampio rispetto ai modelli autoregressivi (ARM), rendendo difficile concentrarsi sui token che guidano il ragionamento in condizioni di mascheramento casuale. Definiamo le scorciatoie causali come catene di token che coprono l’intera sequenza e forniscono indicazioni esplicite verso traiettorie di ragionamento corrette. Analizziamo gli effetti delle scorciatoie causali sull’accuratezza del ragionamento e sulla velocità di convergenza dei DLM e rileviamo che migliorano notevolmente l’efficienza di convergenza delle risposte e l’accuratezza della generazione. Sulla base di questa osservazione, proponiamo un framework di apprendimento delle scorciatoie causali (CSL) per i DLM. In particolare, introduciamo una procedura graduale di estrazione dei token per ricavare dai dati le scorciatoie causali e applichiamo durante l’addestramento un mascheramento parallelo prioritario di questi token, così da consentire una convergenza efficiente e accurata verso le risposte corrette tramite le scorciatoie causali. Esperimenti approfonditi su diversi benchmark di ragionamento e due modelli di base dimostrano che CSL supera costantemente i baseline esistenti basati su varianti di SFT, con un miglioramento medio di $1.92\%$ rispetto ai modelli addestrati solo con SFT e fino a $4.20\%$ su MATH-500. Il codice è disponibile all’indirizzo \href{https://github.com/ZJUDianJin/Causal-Shortcuts-Learning}{https://github.com/ZJUDianJin/Causal-Shortcuts-Learning

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv