Vai al contenuto
AI.info

Ricerca

Multimodal Flow: modellazione unificata del flusso di linguaggio e visione negli spazi degli embedding

Presentiamo Multimodal Flow, un modello generativo interamente continuo per il linguaggio e la visione. La maggior parte dei modelli multimodali unificati rappresenta sia il linguaggio sia le immagini

Multimodal Flow: modellazione unificata del flusso di linguaggio e visione negli spazi degli embedding
arXiv
2609.40362
Pubblicato
2026-09-30
Autori
Hongyuan Tao, Xinggang Wang, Lianghui Zhu, Yongkang Li, Yunchao Wei, Bin Feng, Shaoyu Chen, Qian Zhang, Chang Huang, Kai Yu

Abstract degli autori

Presentiamo Multimodal Flow, un modello generativo interamente continuo per il linguaggio e la visione. La maggior parte dei modelli multimodali unificati rappresenta sia il linguaggio sia le immagini quantizzate come token discreti, oppure combina la predizione discreta del linguaggio con la generazione continua di immagini. Il primo approccio introduce un collo di bottiglia dovuto alla quantizzazione visiva. Il secondo richiede obiettivi e procedure di campionamento diversi a seconda della modalità. Una modellazione interamente continua evita questi compromessi e consente un processo generativo condiviso, ma resta poco esplorata nel preaddestramento multimodale. Multimodal Flow introduce un’architettura continua unificata che integra rappresentazioni continue multimodali con un’architettura di base condivisa, causale per chunk. Organizza blocchi di testo e immagini in hyperchunk continui ordinati, preservando l’ordine dei token testuali e la struttura spaziale delle immagini. L’architettura di base apprende un unico campo vettoriale su questi hyperchunk tramite Flow Matching. Un meccanismo di attenzione congiunta consente l’interazione tra modalità, mentre reti feed-forward specifiche elaborano ciascuna modalità. Durante l’addestramento, il modello predice in parallelo più chunk bersaglio e, durante l’inferenza, genera gli hyperchunk in sequenza. Realizziamo MF-1 e lo preaddestriamo su dati multimodali. Alle scale di 0,6B, 1,2B e 1,6B, il proseguimento del preaddestramento migliora sistematicamente la modellazione multimodale. Con soli 150B token di preaddestramento, MF-1 ottiene un punteggio medio di 82,8 su GenEval e DPG-Bench e di 75,3 su VQAv2, MMBench e POPE, restando competitivo con modelli unificati addestrati su una quantità di dati notevolmente maggiore. A parità di dati, ottimizzazione e numero di parametri, Multimodal Flow supera inoltre modelli ibridi e discreti rappresentativi. Questi risultati affermano la modellazione del flusso negli spazi degli embedding basata su chunk come nuovo paradigma interamente continuo per la modellazione multimodale unificata. Il codice e il modello relativi sono disponibili pubblicamente all’indirizzo https://github.com/hustvl/Multimodal-Flow.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv