Vai al contenuto
AI.info

Ricerca

LoopVL: intelligenza visiva ricorrente

Presentiamo LoopVL per studiare se i Loop Transformers possano essere estesi efficacemente ai modelli visivo-linguistici. LoopVL combina il calcolo Module-Loop e Model-Loop per aggiornare iterativamen

LoopVL: intelligenza visiva ricorrente
arXiv
2609.38426
Pubblicato
2026-09-29
Autori
Zhe Qian, Ziyang Gong, Zhongxing Xu, Hehan Li, Zhonghua Wang, Fei Luo, Mingxuan Wang, Xue Yang, Shiwei liu, Yanbiao Ma, Junchi Yan, Jungong Han

Abstract degli autori

Presentiamo LoopVL per studiare se i Loop Transformers possano essere estesi efficacemente ai modelli visivo-linguistici. LoopVL combina il calcolo Module-Loop e Model-Loop per aggiornare iterativamente uno stato visivo-linguistico unificato attraverso moduli condivisi. Addestriamo LoopVL da zero attraverso il pre-training linguistico, l’addestramento multimodale e il post-training. Nei benchmark di comprensione multimodale e ragionamento visivo, LoopVL supera diversi modelli non ricorrenti di dimensioni analoghe o maggiori. Osserviamo inoltre in LoopVL i Visual Aha Moments, caratterizzati da marcati spostamenti dell’attenzione visiva da un loop all’altro. LoopVL fornisce riscontri concreti a sostegno della modellazione visivo-linguistica ricorrente e offre una prospettiva intuitiva su come i parametri condivisi possano sostenere un calcolo multimodale più profondo su stati visivo-linguistici in continua evoluzione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv