Vai al contenuto
AI.info

Ricerca

DepthBench: misurare come le connessioni residuali consentono una maggiore profondità computazionale

Aumentare la profondità è un modo naturale per accrescere la capacità computazionale dei Transformer, ma il contributo degli strati più profondi può diminuire man mano che la profondità aumenta. Appro

DepthBench: misurare come le connessioni residuali consentono una maggiore profondità computazionale
arXiv
2609.32534
Pubblicato
2026-09-26
Autori
Keyu Wang, Yangyi Huang, Jiale Kang, David González-Martínez, Weiyang Liu, Shiwei Liu

Abstract degli autori

Aumentare la profondità è un modo naturale per accrescere la capacità computazionale dei Transformer, ma il contributo degli strati più profondi può diminuire man mano che la profondità aumenta. Approcci recenti migliorano la normalizzazione (\text{e.g.}, LayerNorm Scaling) o le connessioni residuali (\text{e.g.}, mHC, AttnRes) per favorire il flusso delle informazioni e lo sfruttamento della profondità. Resta però da chiarire se riescano davvero a trasformare una maggiore profondità architetturale in profondità computazionale effettiva e se i miglioramenti riportati derivino da un migliore accesso alle informazioni lungo gli strati oppure da fattori confondenti non considerati. In questo articolo presentiamo \textbf{DepthBench}, un benchmark controllato per studiare la profondità computazionale in diverse architetture. Variamo sistematicamente il rapporto larghezza--profondità ($d_{\text{model}}/n_{\text{layer}}$), passando da configurazioni poco profonde e larghe a configurazioni profonde e strette, mantenendo costanti le dimensioni del modello e la procedura di pre-addestramento. In 10 architetture rappresentative, riscontriamo che il beneficio di destinare più capacità alla profondità dipende fortemente dall’architettura. Il Pre-LN standard e la maggior parte delle sue varianti basate sulla normalizzazione e sullo scaling offrono pochi benefici e possono persino peggiorare le prestazioni quando i modelli diventano più profondi e stretti; HC e Full AttnRes, invece, producono miglioramenti costanti anche in configurazioni estremamente profonde. Questi miglioramenti vanno oltre la riduzione della perdita in fase di pre-addestramento e si traducono sistematicamente in migliori prestazioni specifiche per dominio e in un calcolo effettivo più efficace. Analisi controllate a livello dei singoli strati mostrano inoltre che i miglioramenti di HC e Full AttnRes sono associati a uno sfruttamento più efficace degli strati aggiuntivi, rivelando meccanismi distinti di profondità computazionale nelle diverse architetture. Nel complesso, i nostri risultati individuano nella progettazione delle connessioni residuali un fattore chiave per determinare se la profondità possa costituire una dimensione significativa lungo cui scalare i modelli, consentendo alla profondità architetturale aggiuntiva di tradursi in calcolo effettivo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv