Ricerca
Ripensare il ragionamento visivo latente: ancorare il ragionamento latente alle evidenze visive
Il ragionamento visivo latente (LVR) consente ai modelli linguistici multimodali di grandi dimensioni (MLLM) di svolgere calcoli intermedi in token latenti continui, anziché esprimere a parole ogni pa

- arXiv
- 2609.34563
- Pubblicato
- 2026-09-28
- Autori
- Xi Xiao, Tianchen Zhao, Youngeun Kim, Zhuowei Li, Linghan Xu, Jiaye Wu, Zheng Zhang, Xiang Xu, Xuanbai Chen, Farhan Tejani, Jakub Zablocki, Julia Xu, Yifan Xing
Abstract degli autori
Il ragionamento visivo latente (LVR) consente ai modelli linguistici multimodali di grandi dimensioni (MLLM) di svolgere calcoli intermedi in token latenti continui, anziché esprimere a parole ogni passaggio del ragionamento. A differenza della catena di pensiero testuale (CoT), però, il ragionamento latente non è direttamente osservabile, e questo rende difficile controllare ciò che i token latenti apprendono. In questo lavoro analizziamo anzitutto in modo approfondito il comportamento dei token latenti e individuiamo una lacuna nell’attribuzione del contributo delle evidenze visive: i token latenti reagiscono solo debolmente alle perturbazioni dell’immagine che cambiano la risposta corretta. Ipotizziamo che il problema derivi dall’assenza di una supervisione esplicita durante l’addestramento con GRPO. Questi risultati suggeriscono che una ricompensa basata sulla risposta finale offra indicazioni troppo scarse su quali evidenze visive preservare e su come attribuirne il contributo ai diversi token latenti. Per colmare questa lacuna proponiamo ReaLVR, che applica la supervisione basata sulle evidenze visive alle traiettorie latenti generate autonomamente dal modello. ReaLVR confronta le risposte corrette con quelle errate generate dal modello per individuare dove occorra una supervisione più forte, e le evidenze visive pertinenti con quelle non corrispondenti per stabilire che cosa preservare. In tre famiglie di modelli, ReaLVR supera sistematicamente i metodi di riferimento LVR valutati, raggiungendo su Qwen2.5-VL-7B la media più alta su cinque compiti, pari al 63,7%. Siamo inoltre i primi a portare il ragionamento visivo su larga scala nello spazio latente, mostrando che il nostro approccio continua a produrre miglioramenti solidi anche con modelli di frontiera fino a 235B. Ulteriori analisi mostrano posizioni dei token latenti più sensibili alla domanda, un maggiore allineamento con le regioni visive pertinenti e, a contesto fisso, una maggiore dipendenza dai token latenti che ricevono più attenzione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv