Vai al contenuto
AI.info

Ricerca

La connettività residua strutturata conta nei transformer di diffusione

I Diffusion Transformers (DiT) si sono affermati come architettura di base scalabile per la sintesi di immagini ad alta fedeltà. Tuttavia, a differenza dei modelli di diffusione basati su U-Net, che s

La connettività residua strutturata conta nei transformer di diffusione
arXiv
2609.33203
Pubblicato
2026-09-27
Autori
Yuhe Liu, Xinyin Ma, Gongfan Fang, Songhua Liu, Xinchao Wang

Abstract degli autori

I Diffusion Transformers (DiT) si sono affermati come architettura di base scalabile per la sintesi di immagini ad alta fedeltà. Tuttavia, a differenza dei modelli di diffusione basati su U-Net, che si affidano a connessioni skip rigide e progettate manualmente, i DiT utilizzano prevalentemente un flusso residuo uniforme che integra tutti i livelli precedenti in un unico stato. In questo lavoro ripensiamo le connessioni residue nei transformer di diffusione e proponiamo di trasformarle da un meccanismo di somma passiva a un meccanismo di recupero attivo ottimizzato per la rimozione del rumore dalle immagini. Innanzitutto, conduciamo un’analisi sistematica delle rappresentazioni interne dei DiT, che rivela una preferenza latente per il riutilizzo delle caratteristiche dei primi livelli e per la guida simmetrica tra i livelli. Su questa base, introduciamo una struttura di connessioni che integra esplicitamente connessioni residue locali e percorsi a lungo raggio. Anziché ricorrere a connessioni skip statiche o a collegamenti densi tra tutti i livelli, il nostro metodo consente a ogni blocco transformer di «prestare attenzione» selettivamente alle rappresentazioni precedenti più importanti, recuperando dinamicamente informazioni spaziali e semantiche attraverso percorsi diretti e differenziabili tra livelli a diverse profondità. Gli esperimenti mostrano che la nostra connettività adattiva porta a una convergenza più rapida, con un numero di iterazioni di addestramento fino a $1.73\times$ inferiore, e a miglioramenti significativi del FID e della qualità visiva con meno dello $0.1\%$ di parametri aggiuntivi. Migliora inoltre un modello REPA-XL/2 già valido, portando il FID da $5.9$ a $4.34$ senza guida e raggiungendo un FID di $1.39$ con la guida senza classificatore. I nostri risultati suggeriscono che la connettività adattiva tra livelli sia un fattore cruciale ma ancora poco esplorato nei transformer di diffusione e che l’integrazione di percorsi strutturati per le informazioni offra una via semplice ed efficace per migliorare i modelli generativi scalabili.

Leggi il paper originale su arXiv