Vai al contenuto
AI.info

Ricerca

Dinamiche di percolazione nell’ottimizzazione: cascate della varianza e invarianza di scala discreta

Studiamo le dinamiche della discesa del gradiente stocastico (SGD), che, come è noto, orienta le reti neurali profonde verso insiemi invarianti corrispondenti a sottoreti più semplici. Resta poco chia

Dinamiche di percolazione nell’ottimizzazione: cascate della varianza e invarianza di scala discreta
arXiv
2609.02373
Pubblicato
2026-09-02
Autori
Sai Niranjan Ramachandran, Suvrit Sra

Abstract degli autori

Studiamo le dinamiche della discesa del gradiente stocastico (SGD), che, come è noto, orienta le reti neurali profonde verso insiemi invarianti corrispondenti a sottoreti più semplici. Resta poco chiaro come questo processo si sviluppi nel tempo. Per rispondere, modelliamo il flusso del gradiente stocastico (SGF) come un processo di percolazione in cui le simmetrie architetturali impongono alle sottoreti di fondersi in blocchi discreti e simultanei, anziché una alla volta. Queste transizioni strutturali si manifestano come picchi della varianza di un parametro d’ordine macroscopico, richiamando le transizioni di fase fisiche. Mostriamo inoltre che questo meccanismo di intrappolamento e la cascata di scala a esso associata si estendono ad Adam e AdamW nell’ambito di un modello esplicito di rumore a code pesanti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv