Ricerca
FuseReg: regolarizzare la fusione dei livelli riduce il divario tra ricostruzione e generazione negli autoencoder di rappresentazione
Gli autoencoder di rappresentazione (RAE) riutilizzano le caratteristiche estratte da un encoder visivo preaddestrato come rappresentazioni latenti per la ricostruzione e la diffusione, integrando cos

- arXiv
- 2609.31620
- Pubblicato
- 2026-09-25
- Autori
- Hongyang Du, Yunfei Xie, Junjie Ye, Jiawei Yang, Xiaoyan Cong, Haodong Zhang, Yongchao Huang, Haiyu Wu, Zongxia Li, Shihang Gui, Dawei Liu, Runhao Li, Jingcheng Ni, Chen Wei, Randall Balestriero, Yue Wang
Abstract degli autori
Gli autoencoder di rappresentazione (RAE) riutilizzano le caratteristiche estratte da un encoder visivo preaddestrato come rappresentazioni latenti per la ricostruzione e la diffusione, integrando così rappresentazioni visive efficaci nella generazione di immagini. I RAE devono però ancora stabilire quali livelli dell’encoder debbano formare lo spazio latente condiviso dal generatore e dal decoder di pixel. Questa scelta comporta un compromesso: i livelli meno profondi tendono a conservare meglio i dettagli fini dei pixel, mentre quelli più profondi tendono a ottenere risultati migliori nelle metriche di generazione. Una fusione dei livelli basata su un’euristica fissa vincola quindi tra loro due fasi che traggono beneficio da informazioni diverse. Presentiamo FuseReg, che sostituisce la selezione euristica delle caratteristiche con un addestramento su sottoinsiemi casuali dei livelli dell’encoder. Analizziamo teoricamente il meccanismo alla base del metodo: il campionamento dei sottoinsiemi penalizza esplicitamente la sensibilità alle divergenze tra livelli. Su ImageNet-256 con DINOv3-L, un unico decoder FuseReg ricostruisce a partire da fusioni complete, sparse o basate su un solo livello senza essere riaddestrato, ottenendo un PSNR più alto rispetto a decoder specializzati per fusioni fisse. Questa flessibilità giova anche alla generazione: la sola sostituzione del decoder riduce del 27% il gFID senza guidance, lasciando invariato il generatore RAEv2 DiT-XL. Lo stesso principio di regolarizzazione si estende all’addestramento della diffusione: la regolarizzazione congiunta di entrambe le fasi riduce del 29% il gFID senza guidance su DiT-Base. Questi risultati mostrano che addestrare i modelli a valle a essere robusti rispetto alla fusione dei livelli riduce il divario tra ricostruzione e generazione senza modificare l’encoder preaddestrato.