Vai al contenuto
AI.info

Ricerca

LLaDA-UI: la diffusione a blocchi per gli agenti GUI visivo-linguistici

I grandi modelli linguistici a diffusione (dLLM) raggiungono un’elevata efficienza di decodifica grazie alla generazione parallela per blocchi e in ordine arbitrario, caratteristiche che li rendono in

LLaDA-UI: la diffusione a blocchi per gli agenti GUI visivo-linguistici
arXiv
2609.13287
Pubblicato
2026-09-09
Autori
Zhangxuan Gu, Haoxing Chen, Qi Qin, Yi Xin, Kai Gan, Lin Liu, Long Cui, Xiaomei Wang, Beitong Zhou, Yunzhu Zhang, Zhengwen Zeng, Changlong Gao, Weizhi Chen, Rongchao Zhang, Haoyuan Wu, Shuheng Shen, Changhua Meng, Weiqiang Wang, Jianguo Li, Zhenzhong Lan

Abstract degli autori

I grandi modelli linguistici a diffusione (dLLM) raggiungono un’elevata efficienza di decodifica grazie alla generazione parallela per blocchi e in ordine arbitrario, caratteristiche che li rendono interessanti per le applicazioni sensibili alla latenza. Gli agenti GUI sono un banco di prova naturale per questo paradigma: devono percepire ripetutamente lo stato dello schermo e produrre in tempo reale azioni strutturate e ancorate spazialmente. Resta però da chiarire se i dLLM possano diventare agenti GUI multimodali capaci senza perdere il vantaggio della decodifica parallela. Presentiamo LLaDA-UI, un agente GUI visivo-linguistico a diffusione a blocchi, basato su MoE e con 16,7 miliardi di parametri. LLaDA-UI segue un percorso di addestramento in due fasi: un pre-addestramento multimodale generale allinea un codificatore visivo a risoluzione nativa con l’architettura linguistica a diffusione LLaDA2.0-mini-base; segue un fine-tuning supervisionato per agenti GUI su dati eterogenei relativi a dispositivi mobili, desktop, web e grounding. Nei benchmark di grounding ampiamente adottati e nei benchmark di navigazione su più piattaforme, LLaDA-UI supera nettamente Qwen2.5-VL-7B e supera Qwen3-VL-8B in quattro dei sei benchmark GUI riportati. Questi risultati mostrano che la diffusione a blocchi è un paradigma generativo praticabile per gli agenti GUI multimodali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv