Vai al contenuto
AI.info

Ricerca

Un blocco, più profondità: transformer visivi ricorrenti con esperti programmati in funzione della profondità

In questo lavoro mostriamo che un singolo blocco Transformer, applicato ricorrentemente, può eguagliare l’accuratezza di un encoder visivo a profondità piena con un numero comparabile di FLOPs in infe

arXiv
2610.12448
Pubblicato
2026-10-08
Autori
Adrian Bulat, Yassine Ouali, Georgios Tzimiropoulos

Abstract degli autori

In questo lavoro mostriamo che un singolo blocco Transformer, applicato ricorrentemente, può eguagliare l’accuratezza di un encoder visivo a profondità piena con un numero comparabile di FLOPs in inferenza, senza distillazione delle rappresentazioni intermedie. reViT ripristina trasformazioni specifiche per ciascuna profondità rappresentando la FFN a ogni profondità ricorrente come combinazione convessa di un piccolo insieme condiviso di esperti. Una coordinata continua di profondità normalizzata determina questa combinazione, definendo una traiettoria ricampionabile nello spazio dei parametri della FFN. Valutiamo questo approccio in due contesti: l’addestramento supervisionato su ImageNet-1k e la distillazione da un modello insegnante DINOv2. In entrambi, adattamenti controllati individuano nella fusione nello spazio dei pesi la famiglia MoE più efficace tra quelle testate a parità di budget di una FFN, davanti alle alternative basate sull’instradamento dei token e sulla combinazione degli output. Addestrato da zero, reViT-B/16 raggiunge l’accuratezza di DeiT III con circa il 70\% di parametri memorizzati in meno. Un modello con 8 esperti, distillato usando soltanto le rappresentazioni in uscita del modello insegnante, conserva quasi tutta l’accuratezza del modello insegnante DINOv2 nella valutazione con un classificatore lineare e trasferisce le proprie capacità alla classificazione, alla segmentazione e alla previsione della profondità. L’addestramento a profondità variabile consente a un unico checkpoint (modello addestrato) di operare a diverse profondità testate ricampionando lo stesso intervallo di coordinate normalizzate. Per l’impiego a profondità fissa, il blocco ricorrente può essere materializzato come un grafo denso convenzionale, eliminando l’instradamento e la fusione durante l’esecuzione senza modificare il costo computazionale di una FFN per profondità, ma aumentando lo spazio di archiviazione necessario per l’impiego.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv