Vai al contenuto
AI.info

Ricerca

Alla scoperta della sinergia tra comprensione e generazione nei modelli multimodali unificati nativi: dalla rappresentazione ai compiti fino al sistema

Sebbene i modelli multimodali unificati (UMMs) svolgano sia compiti di comprensione visiva sia compiti di generazione all’interno di un unico modello, l’unificazione funzionale non garantisce una sine

Alla scoperta della sinergia tra comprensione e generazione nei modelli multimodali unificati nativi: dalla rappresentazione ai compiti fino al sistema
arXiv
2609.01607
Pubblicato
2026-09-01
Autori
Penghao Wu, Haiwen Diao, Weichen Fan, Lewei Lu, Dahua Lin, Ziwei Liu

Abstract degli autori

Sebbene i modelli multimodali unificati (UMMs) svolgano sia compiti di comprensione visiva sia compiti di generazione all’interno di un unico modello, l’unificazione funzionale non garantisce una sinergia nell’apprendimento: i due obiettivi possono rafforzarsi a vicenda, competere per le risorse del modello o limitarsi a coesistere. Esaminiamo il loro rapporto a livello di rappresentazione, di compiti e di sistema in un contesto controllato e strutturalmente nativo, senza conoscenze visive pregresse acquisite con il preaddestramento. A livello di rappresentazione, osserviamo che ciascun obiettivo fornisce segnali utili all’altro: la generazione arricchisce le caratteristiche visive apprese per la comprensione, mentre la comprensione rafforza l’allineamento tra visione e linguaggio per la generazione. Tuttavia, quando entrambi gli obiettivi devono seguire lo stesso percorso computazionale, uno tende a prevalere. Un’architettura che separa i compiti, specializzando le componenti dell’elaborazione visiva in cui i due obiettivi sono in conflitto e preservando al tempo stesso l’interazione semantica, evita questo degrado asimmetrico. A livello di compiti, attraverso tre casi di studio, riscontriamo un trasferimento positivo in entrambe le direzioni quando i compiti di comprensione e generazione si basano su conoscenze condivise. A livello di sistema, mostriamo che un UMM end-to-end supera una pipeline comparabile composta da pianificatore ed esecutore nei compiti complessi che richiedono esplicitamente sia la comprensione sia la generazione di immagini. Nel complesso, questi risultati mostrano che il valore degli UMMs va oltre un’interfaccia unificata: un’adeguata specializzazione, conoscenze condivise tra i compiti e un’ottimizzazione end-to-end possono trasformare la coesistenza in sinergia.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv