Vai al contenuto
AI.info

Ricerca

Ottimizzazione della policy a livello di regione per la percezione a grana fine degli MLLM

La percezione visiva a grana fine negli MLLM viene comunemente migliorata aumentando la risoluzione, ma i token visivi aggiuntivi fanno crescere i costi della codifica visiva e del prefilling del mode

Ottimizzazione della policy a livello di regione per la percezione a grana fine degli MLLM
arXiv
2609.19745
Pubblicato
2026-09-17
Autori
Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

Abstract degli autori

La percezione visiva a grana fine negli MLLM viene comunemente migliorata aumentando la risoluzione, ma i token visivi aggiuntivi fanno crescere i costi della codifica visiva e del prefilling del modello linguistico. Mostriamo che le due operazioni alla base della percezione a grana fine, individuare la regione di interesse (RoI) e riconoscerne il contenuto, richiedono risoluzioni diverse. In un test diagnostico controllato, l’individuazione della regione tollera una compressione dei token all’incirca da 3 a 4 volte maggiore rispetto al riconoscimento. Questo suggerisce di individuare la regione da una vista a bassa risoluzione e concentrare la risoluzione sulle evidenze selezionate. La decodifica delle coordinate tramite l’MLLM può essere addestrata end-to-end a partire dalle risposte, ma richiede un passaggio completo del modello per ogni query e dipende dalla sua capacità di grounding. Una rete leggera che propone le regioni, distillata dall’attenzione del modello, è veloce, ma eredita il rumore delle distribuzioni di attenzione usate come riferimento. La RoI prodotta da questa rete influisce sulla risposta attraverso una scelta discreta della regione: la sua fedeltà alla risposta non può quindi essere usata per supervisionare la rete. Per questo ottimizziamo la rete con l’apprendimento per rinforzo a livello di regione, che chiamiamo Vision-RL2. Il metodo tratta le regioni coerenti come azioni, e un MLLM lettore i cui parametri restano fissi valuta ciascuna regione in base a come la sua rimozione modifica la probabilità della risposta. Obiettivi complementari, sottrattivi e additivi, sopprimono le regioni proposte che distraggono e recuperano le evidenze mancanti, aggiornando soltanto il predittore senza annotazioni delle regioni, campionamento delle risposte o traiettorie di ragionamento. La rete così perfezionata consente inoltre una codifica sparsa che ingrandisce le evidenze ed esclude i token dello sfondo. Su sei benchmark di percezione a grana fine e quattro modelli MLLM di base, Vision-RL2 migliora l’accuratezza rispetto al modello di partenza con ogni budget di token e supera l’accuratezza ottenuta da quest’ultimo con il budget più elevato usando circa 4 volte meno token visivi. Il codice è disponibile all’indirizzo https://github.com/YuHengsss/VisionRL2 .

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv