Ricerca
PixelDense: la predizione densa come allineamento delle rappresentazioni per la diffusione sui pixel
L’allineamento delle rappresentazioni (REPA) accelera l’addestramento dei transformer per la diffusione, ma i suoi obiettivi di allineamento sono quasi esclusivamente encoder semantici come DINOv2 e C

- arXiv
- 2610.00483
- Pubblicato
- 2026-09-30
- Autori
- Lehan Yang, Daiqing Qi, Wenhao Zhang, Avery Li, Yiqing Yang, Yifan Li, Yu Kong, Haitian Zheng, Zhifei Zhang, Zhe Lin, Varun Jampani, Sheng Li
Abstract degli autori
L’allineamento delle rappresentazioni (REPA) accelera l’addestramento dei transformer per la diffusione, ma i suoi obiettivi di allineamento sono quasi esclusivamente encoder semantici come DINOv2 e CLIP. Analisi recenti indicano che l’effetto dell’allineamento dipende dalla struttura spaziale, non dalla semantica globale. Eppure, i modelli di base per la predizione densa addestrati a prevedere tale struttura restano trascurati come obiettivi per REPA. Nella diffusione nello spazio dei pixel, SAM2, Depth Anything v2 e Metric3D v2 superano ciascuno la baseline GenEval basata soltanto su DINOv2, con i due modelli teacher geometrici davanti a quello per la segmentazione. Una semplice somma dei quattro modelli teacher, tuttavia, ottiene un risultato inferiore a quello del miglior modello teacher geometrico usato da solo, perché i gradienti semantici e geometrici competono per un’unica proiezione del denoiser. Introduciamo PixelDense, che instrada DINOv2 e SAM2 attraverso un flusso di proiezione semantico e Depth Anything v2 e Metric3D v2 attraverso un flusso di proiezione geometrico, aggiungendo una penalità di ortogonalità nello spazio dei pesi che mantiene i due flussi in sottospazi disgiunti. Tutti e quattro i modelli teacher restano congelati durante l’addestramento e vengono esclusi durante l’inferenza. Applicato a PixelGen e DeCo con un’unica procedura, PixelDense migliora i risultati su GenEval, DPG-Bench e HPS v2.1, porta il GenEval Overall di PixelGen-XXL da 0,7927 a 0,8093 e supera tutte le varianti con un solo modello teacher e quelle con più modelli teacher senza separazione dei flussi. Nella ricostruzione a partire da rumore parziale, sonde indipendenti per la segmentazione panottica, la profondità e le normali alla superficie mostrano un aumento del PQ fino al 53,1% e una riduzione dell’AbsRel della profondità fino al 36,0% a $τ=0.5$ su COCO e Flickr30K. Partendo da un’inizializzazione casuale, PixelDense raggiunge inoltre il massimo risultato della baseline su GenEval 1,23 volte più velocemente. Nelle modifiche con SDEdit su PIE-Bench, PixelDense conserva maggiormente lo sfondo e la disposizione degli elementi dell’immagine di partenza a ogni intensità della modifica, aumentando il PSNR dello sfondo fino a 2,2 dB.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv