Ricerca
LoopVL: intelligenza visiva ricorrente
Presentiamo LoopVL per studiare se i Loop Transformers possano essere estesi efficacemente ai modelli visivo-linguistici. LoopVL combina il calcolo Module-Loop e Model-Loop per aggiornare iterativamen

- arXiv
- 2609.38426
- Pubblicato
- 2026-09-29
- Autori
- Zhe Qian, Ziyang Gong, Zhongxing Xu, Hehan Li, Zhonghua Wang, Fei Luo, Mingxuan Wang, Xue Yang, Shiwei liu, Yanbiao Ma, Junchi Yan, Jungong Han
Abstract degli autori
Presentiamo LoopVL per studiare se i Loop Transformers possano essere estesi efficacemente ai modelli visivo-linguistici. LoopVL combina il calcolo Module-Loop e Model-Loop per aggiornare iterativamente uno stato visivo-linguistico unificato attraverso moduli condivisi. Addestriamo LoopVL da zero attraverso il pre-training linguistico, l’addestramento multimodale e il post-training. Nei benchmark di comprensione multimodale e ragionamento visivo, LoopVL supera diversi modelli non ricorrenti di dimensioni analoghe o maggiori. Osserviamo inoltre in LoopVL i Visual Aha Moments, caratterizzati da marcati spostamenti dell’attenzione visiva da un loop all’altro. LoopVL fornisce riscontri concreti a sostegno della modellazione visivo-linguistica ricorrente e offre una prospettiva intuitiva su come i parametri condivisi possano sostenere un calcolo multimodale più profondo su stati visivo-linguistici in continua evoluzione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv