Ricerca
OmniTaskonomy: quando la generazione visiva migliora la comprensione visiva?
Addestrare un modello a generare contenuti visivi può favorire lo sviluppo di ricche capacità percettive legate alla geometria, alle relazioni spaziali e alla capacità di riconoscere gli oggetti come

- arXiv
- 2609.38079
- Pubblicato
- 2026-09-29
- Autori
- Jiaxin Ge, Yiming Qin, Ji Xie, Haozhe Jiang, Xiaochuang Han, Junyi Zhang, Andrew Dai, Yinfei Yang, Jitendra Malik, Ranjay Krishna, Sewon Min, Haiwen Feng, Le Xue, Baifeng Shi, Trevor Darrell, XuDong Wang
Abstract degli autori
Addestrare un modello a generare contenuti visivi può favorire lo sviluppo di ricche capacità percettive legate alla geometria, alle relazioni spaziali e alla capacità di riconoscere gli oggetti come tali; non è però ancora chiaro quali benefici ne derivino per la comprensione visiva. Ci chiediamo: quando e in che modo la supervisione basata sulla generazione visiva migliora la comprensione visiva? Studiamo coppie controllate di compiti di generazione da immagine a immagine (I2I) e di comprensione da immagine a testo (I2T) che esprimono lo stesso problema di fondo in diverse modalità di output. Scopriamo che, con la giusta impostazione, l’addestramento I2I migliora le prestazioni nei compiti I2T successivi, con guadagni maggiori all’aumentare dei dati usati per l’addestramento I2I. Ci chiediamo poi quali compiti di generazione favoriscano quali capacità di comprensione. Per studiare il trasferimento oltre le coppie di compiti, introduciamo OmniTaskonomy, una tassonomia unificata che comprende 19 compiti di generazione I2I e 25 capacità di comprensione I2T. La mappa del trasferimento che ne risulta rivela benefici selettivi, dipendenti dal compito. Alcuni seguono corrispondenze intuitive: per esempio, la previsione della profondità migliora il ragionamento metrico 3D, l’indicazione degli oggetti migliora il conteggio e la ricostruzione di puzzle migliora l’ordinamento 2D. Emergono però anche connessioni sorprendenti: la segmentazione 2.5D migliora il riconoscimento delle categorie e la previsione della profondità Z migliora la localizzazione. Per approfondire questi risultati, analizziamo l’allineamento dei gradienti tra i compiti di generazione e quelli di comprensione e scopriamo che un allineamento maggiore è associato a guadagni più ampi nel trasferimento ai compiti successivi. Nel complesso, i nostri risultati mostrano che la generazione visiva è una ricca fonte di supervisione per la comprensione visiva e tracciano un percorso per sfruttarne i benefici attraverso la giusta sequenza di addestramento e la scelta dei compiti. Pagina del progetto: https://omni-taskonomy.github.io/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv