Vai al contenuto
AI.info

Ricerca

Codifica sparsa convoluzionale adattiva tramite collo di bottiglia informativo per una rappresentazione robusta dei segnali visivi

I segnali visivi richiedono rappresentazioni compatte ma sufficienti per garantire previsioni robuste nelle fasi successive. La codifica sparsa convoluzionale (CSC) offre un meccanismo esplicito per s

Codifica sparsa convoluzionale adattiva tramite collo di bottiglia informativo per una rappresentazione robusta dei segnali visivi
arXiv
2609.19122
Pubblicato
2026-09-16
Autori
Meng'en Qin, Yinchen Liu, Mingxuan Cui, Youlu Xing

Abstract degli autori

I segnali visivi richiedono rappresentazioni compatte ma sufficienti per garantire previsioni robuste nelle fasi successive. La codifica sparsa convoluzionale (CSC) offre un meccanismo esplicito per sopprimere le componenti ridondanti preservando al contempo il contenuto del segnale, ma il suo coefficiente di sparsità è in genere fisso e scelto manualmente. Proponiamo un framework di codifica sparsa convoluzionale adattiva per rappresentare in modo robusto i segnali visivi. In particolare, srotoliamo l’ottimizzazione della CSC con l’algoritmo Fast Iterative Shrinkage-Thresholding (FISTA) e trattiamo il coefficiente di sparsità come una variabile differenziabile, appresa congiuntamente ai parametri della rete. Dal punto di vista del collo di bottiglia informativo, questo coefficiente regola il compromesso tra conservazione dell’informazione e compressione: il termine di sparsità favorisce rappresentazioni compatte, mentre il termine di ricostruzione, insieme alla funzione di perdita del compito, preserva il contenuto del segnale rilevante per il compito. Introduciamo inoltre una strategia post-addestramento senza etichette, che regola l’intensità della compressione per input corrotti mantenendo fissi i parametri principali della rete. Gli esperimenti su CIFAR e ImageNet dimostrano prestazioni competitive nel riconoscimento su dati puliti e una robustezza notevolmente maggiore in presenza di diverse perturbazioni degli input.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv