Vai al contenuto
AI.info

Ricerca

VisionHOPE: i backbone visivi come sistemi di apprendimento che si automodificano

I backbone visivi si sono evoluti dalle reti neurali convoluzionali (CNN), basate sull’aggregazione locale, ai Vision Transformers (ViTs), basati su interazioni globali, ai modelli a spazio di stato (

VisionHOPE: i backbone visivi come sistemi di apprendimento che si automodificano
arXiv
2609.33325
Pubblicato
2026-09-27
Autori
Siran Peng, Tianshuo Zhang, Tianyu Fu, Weisong Zhao, Haoyuan Zhang, Jiankuo Zhao, Minghui Wu, Ping Jiang, Xiangyu Zhu, Chenxu Zhao, Zhen Lei

Abstract degli autori

I backbone visivi si sono evoluti dalle reti neurali convoluzionali (CNN), basate sull’aggregazione locale, ai Vision Transformers (ViTs), basati su interazioni globali, ai modelli a spazio di stato (SSMs), con transizioni di stato dipendenti dall’input, fino ai livelli di Test-Time Training (TTT), che adattano un modello di apprendimento interno durante l’elaborazione di un’immagine. Nel corso di questa evoluzione, l’elaborazione visiva è diventata sempre più adattiva rispetto a ciascun input, ma le regole che governano tale adattamento restano in larga misura prescritte dal backbone addestrato. Presentiamo VisionHOPE, il primo backbone visivo generico formulato come sistema di apprendimento che si automodifica, in cui ciò che il modello ricorda e il modo in cui apprende coevolvono all’interno di un’immagine. Basandosi sulla costruzione autoreferenziale di Nested Learning (NL), VisionHOPE realizza questa coevoluzione attraverso cinque memorie interconnesse che conservano contenuti, generano rappresentazioni di chiavi e valori e regolano il tasso di apprendimento e la ritenzione. Queste memorie evolvono congiuntamente man mano che il contesto visivo si accumula lungo ciascuna scansione. Tuttavia, applicare direttamente a un backbone visivo l’aggiornamento autoreferenziale privo di vincoli provoca instabilità. Deriviamo quindi uno schema di controllo dell’ampiezza del passo commisurato alla stabilità, che combina un limite graduale all’iniezione autoreferenziale con un vincolo spettrale sulla transizione della memoria conservata, e dimostriamo che le dinamiche di memoria risultanti sono non espansive lungo ciascuna scansione. Per le mappe di caratteristiche bidimensionali, adattiamo la formulazione in blocchi di NL allineando i blocchi alle righe e alle colonne dell’immagine nelle quattro scansioni direzionali. VisionHOPE ottiene risultati competitivi su ImageNet-1K, COCO e ADE20K, affermando i sistemi di apprendimento che si automodificano come base praticabile per backbone visivi di uso generale. Il codice è disponibile all’indirizzo https://github.com/PSRben/VisionHOPE.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv