Ricerca
PixelUMM: comprensione e generazione unificate di immagini e video senza encoder
I modelli multimodali unificati (UMM) si basano spesso su rappresentazioni visive separate per la comprensione e la generazione, aumentando la lunghezza del contesto visivo e complicando l’integrazion

- arXiv
- 2609.38597
- Pubblicato
- 2026-09-29
- Autori
- Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang, Jay Zhangjie Wu
Abstract degli autori
I modelli multimodali unificati (UMM) si basano spesso su rappresentazioni visive separate per la comprensione e la generazione, aumentando la lunghezza del contesto visivo e complicando l’integrazione con le pipeline consolidate di preaddestramento visione-linguaggio. I recenti progressi nella modellazione nello spazio dei pixel offrono un’alternativa senza encoder, ma estendere questo approccio dalle immagini ai video non è semplice: la comprensione e la generazione di video adottano rappresentazioni temporali diverse, lasciando aperta la questione di come progettare un’interfaccia visiva unificata. Presentiamo PixelUMM, un modello senza encoder per la comprensione e la generazione unificate di immagini e video direttamente nello spazio dei pixel. PixelUMM rappresenta le immagini come patch spaziali e i video come tubelet spaziotemporali, collegando i pixel grezzi a un’architettura multimodale condivisa tramite proiezioni lineari a singolo strato. La sua architettura Mixture-of-Transformers combina un meccanismo di attenzione condiviso con parametri specifici per ciascun compito ed estende la predizione dei pixel puliti alla generazione di video, supportando congiuntamente la predizione autoregressiva del testo e il flow matching nello spazio dei pixel. Gli esperimenti mostrano che PixelUMM ottiene prestazioni competitive nei compiti di comprensione e generazione di immagini e video. Conduciamo inoltre studi empirici sulle principali scelte progettuali, tra cui la progettazione del decoder e la dimensione delle patch spaziotemporali, offrendo indicazioni per i futuri modelli multimodali unificati nello spazio dei pixel.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv