Ricerca
LLaDA-Image: creare potenti generatori di immagini con procedure di addestramento completamente aperte
Presentiamo LLaDA-Image, un framework unificato che abbina un Diffusion Transformer (DiT) da 6 miliardi di parametri, addestrato da zero, a un modulo di comprensione visivo-linguistica con parametri c

- arXiv
- 2609.03796
- Pubblicato
- 2026-09-03
- Autori
- Chuyan Chen, Haoxing Chen, Kun Chen, Zhenglin Cheng, Long Cui, Ruishan Fang, Zhangxuan Gu, Zhicheng Huang, Zhenzhong Lan, Yuanting Lei, Haoquan Li, Jianguo Li, Rongchuan Li, Sidu Li, Tao Lin, Deyuan Liu, Jiacheng Liu, Lin Liu, Yuxuan Lou, Zhisheng Lu, Yuxin Ma, Shuheng Shen, Peng Sun, Chaoyang Wang, Hongjun Wang, Xiaomei Wang, Yongxin Wang, Chengzhang Wu, Hongru Wu, Jun Xie
Abstract degli autori
Presentiamo LLaDA-Image, un framework unificato che abbina un Diffusion Transformer (DiT) da 6 miliardi di parametri, addestrato da zero, a un modulo di comprensione visivo-linguistica con parametri congelati, basato sul modello linguistico a diffusione LLaDA2.0-Mini. Anziché affidarci fin dall’inizio soprattutto a dati costituiti da coppie immagine-testo, costruiamo prima una solida base per la generazione visiva attraverso il preaddestramento e l’addestramento intermedio su sole immagini. La pipeline di generazione comprende 220 milioni di campioni, 98 dei quali sono immagini reali. Per rendere l’ottimizzazione efficiente e scalabile, utilizziamo RMSNorm senza parametri in tutto il DiT, insieme all’ottimizzatore Muon. Il modello unificato così ottenuto produce immagini altamente fotorealistiche e segue con precisione istruzioni di modifica dettagliate. Distilliamo inoltre LLaDA-Image in LLaDA-Image-Turbo, consentendo un’inferenza rapida in 2-4 passaggi di campionamento. Su Qwen-Image-Bench, LLaDA-Image ottiene punteggi complessivi di 53,53 e 53,38 rispettivamente nei percorsi in inglese e in cinese, stabilendo un nuovo stato dell’arte tra i modelli open source in entrambi. Per sostenere ulteriori ricerche su modelli generativi capaci ed efficienti, rendiamo disponibili i pesi del modello, il codice di addestramento e le procedure dettagliate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv