Ricerca
SenseNova-U1.5: verso un’intelligenza visiva unificata nativa
Presentiamo SenseNova-U1.5, un modello multimodale unificato nativo 8B-MoT che comprende contenuti visivi, ragiona su di essi e li genera in un’architettura priva di encoder e VAE. Rafforziamo la sua

- arXiv
- 2609.11929
- Pubblicato
- 2026-09-10
- Autori
- Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen, Ruixi Zhang, Ruohui Wang, Wenwen Tong, Xiangyu Fan, Yubo Wang, Yue Zhu, Yuwei Niu, Zhengqi Bai, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Bo Yang, Chen Feng, Chengguang Lv, Guangjia Liu, Guanlin Wang, Hanyu Zhang, Haojia Yu, Hongcan Xiao, Hongli Wang, Huan Wu, Huaping Zhong, Jian Fang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jing Zuo, Jingcheng Ni, Junxiang Xu, Linjun Dai, Mutian Xu, Peishen Yan, Penghao Wu, Ruijie Mao, Ruisi Wang, Shihao Bai, Shuang Yang, Shuya Yang, Shuyan Zheng, Silei Wu, Siying Li, Tao Chu, Tianbo Zhong, Tongxi Zhou, Weichao Luo, Weichen Fan, Wenhao Jia, Wenjie Gao, Xiangli Kong, Yan Li, Yang Yong, Zimo Wen, Zixuan Qian, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin
Abstract degli autori
Presentiamo SenseNova-U1.5, un modello multimodale unificato nativo 8B-MoT che comprende contenuti visivi, ragiona su di essi e li genera in un’architettura priva di encoder e VAE. Rafforziamo la sua interfaccia visiva attraverso una ricostruzione delle patch spazialmente coerente e ampliamo la scala dell’addestramento con dati di generazione e di editing accuratamente selezionati, una migliore formulazione dei compiti, un potenziamento strutturale dei prompt e risoluzioni native fino a 4K. Nella fase successiva all’addestramento, ottimizziamo esperti specializzati nell’estetica visiva, nella resa del testo bilingue, nella generazione di infografiche e nell’editing delle immagini, e ne consolidiamo le capacità attraverso una distillazione on-policy multi-esperto. In un’ampia serie di valutazioni, SenseNova-U1.5 migliora notevolmente la fedeltà delle immagini, la resa del testo, la composizione complessa, l’editing basato su più riferimenti e la generazione intercalata, migliorando al contempo l’aderenza alle istruzioni e preservando l’identità del soggetto, la geometria e le regioni non modificate. Nonostante la limitata esposizione a formati strutturati nei suoi dati di generazione, SenseNova-U1.5 generalizza efficacemente a istruzioni visive lunghe, complesse e strutturate, dimostrando ulteriormente che la comprensione multimodale può trasferirsi alla pianificazione e alla creazione visiva. Nel complesso, questi risultati indicano che la modellazione unificata nativa è una via promettente verso sistemi che percepiscono, ragionano e creano in un framework interamente end-to-end. Renderemo open source il codice di addestramento, incluso quello per il fine-tuning supervisionato, l’apprendimento per rinforzo e la distillazione on-policy.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv