Ricerca
Capacità spettrale neurale: misurare e progettare architetture dalla sola specifica della rete
La progettazione e la compressione dei Transformer moderni si riducono entrambe ad allocare capacità entro un budget. Le metriche scalari standard per queste decisioni, #Params e #FLOPs, misurano le d

- arXiv
- 2609.23087
- Pubblicato
- 2026-09-19
- Autori
- Chenyu Zhu, Ruoyu Zhao, Zhichao Lu
Abstract degli autori
La progettazione e la compressione dei Transformer moderni si riducono entrambe ad allocare capacità entro un budget. Le metriche scalari standard per queste decisioni, #Params e #FLOPs, misurano le dimensioni e il calcolo, ma non la struttura architetturale: due architetture con budget di parametri identici, ma diverse per allocazione di profondità e larghezza, teste o FFN, ottengono punteggi identici, pur comportandosi in modo diverso. Proponiamo la Neural Spectral Capacity (NSC), una metrica scalare in forma chiusa basata sullo spettro dei valori singolari di ciascuna matrice dei pesi. Con la normale inizializzazione casuale, la legge di Marchenko-Pastur consente di calcolare la NSC basandosi sulla sola specifica architetturale, senza istanziare il modello né ricorrere a dati o gradienti. La sua struttura additiva, strato per strato, permette di usare NSC-DP, un risolutore esatto basato sulla programmazione dinamica che in pochi secondi, su una CPU, restituisce l’architettura che massimizza globalmente la NSC nel rispetto dei vincoli di risorse: una garanzia impossibile da ottenere con la ricerca black-box basata sulle proxy esistenti, che non richiedono training. Sul piano empirico, NSC supera #Params, #FLOPs e alcune proxy rappresentative che non richiedono training nell’ordinamento di sette famiglie di Transformer e CNN (su FlexiBERT, $τ= 0.505$ per coppie che differiscono di meno del 10% in #Params, mentre #Params scende a 0,082); NSC-DP individua in 2 secondi un’architettura Transformer-XL per WikiText-103 che supera la baseline progettata da esseri umani; infine, riduce LLaMA-7B al miglior modello da 5,7B su otto attività di ragionamento di senso comune, senza alcun dato di calibrazione e a una velocità circa 5.900 volte superiore rispetto alla più solida baseline basata su una proxy che non richiede training.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv