Ricerca
Mixture of Layers: instradamento dinamico dei livelli per il ragionamento visivo
Gli encoder visivi preaddestrati contengono rappresentazioni visive che variano da un livello all’altro per granularità spaziale, grado di astrazione semantica e sensibilità ai dettagli locali. Tuttav

- arXiv
- 2610.09440
- Pubblicato
- 2026-10-07
- Autori
- Jeonghwan Kim, Sofia Stoica, Jiwan Chung, Ansel Blume, Hyeonjeong Ha, Zhenhailong Wang, Xin Luna Dong, Heng Ji
Abstract degli autori
Gli encoder visivi preaddestrati contengono rappresentazioni visive che variano da un livello all’altro per granularità spaziale, grado di astrazione semantica e sensibilità ai dettagli locali. Tuttavia, la maggior parte dei modelli linguistici multimodali di grandi dimensioni (MLLMs) usa soltanto le rappresentazioni dell’ultimo o del penultimo livello dell’encoder visivo, oppure regole di aggregazione fisse. L’astrazione visiva risulta così in larga misura indipendente dalla query, e l’accesso a indizi a grana fine, come piccoli oggetti, dettagli spaziali, testo e caratteristiche visive sottili, è limitato. In questo lavoro proponiamo Mixture of Layers (MoL), un approccio all’instradamento dei livelli condizionato dalle istruzioni che opera a livello di patch visiva e aggrega dinamicamente le rappresentazioni latenti pertinenti alla query provenienti dai livelli intermedi dell’encoder visivo. Data una query testuale, MoL predice le probabilità di instradamento tra i livelli dell’encoder visivo ed esegue un’aggregazione sparsa top-k degli stati nascosti selezionati, a livello di immagine o di patch, oppure attraverso un meccanismo di instradamento ibrido. MoL consente così di accedere, in funzione della query, alle caratteristiche visive specifiche dei diversi livelli per il ragionamento visivo a grana fine. I nostri esperimenti su 7 compiti di ragionamento visivo a grana fine mostrano miglioramenti sostanziali delle prestazioni, soprattutto nei compiti di localizzazione e comprensione visiva a grana fine: rispetto agli MLLMs di riferimento, l’accuratezza complessiva migliora del 18,9% su V*, del 4,5% su HRBench4K e del 16,3% su CharXiv, senza ricorrere a input a risoluzioni multiple, alla semplice combinazione di più encoder visivi o a un aumento del numero di token di patch. Studiamo le dimensioni dei campi recettivi degli encoder visivi nei diversi livelli e i loro comportamenti di campionamento per analizzare in profondità perché il campionamento tra livelli sia utile, mostrando che le rappresentazioni visive condizionate sono un passo fondamentale verso una migliore percezione visiva e un migliore ragionamento negli MLLMs. La pagina del nostro progetto è disponibile all’indirizzo https://wjdghks950.github.io/mol.github.io/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv