Ricerca
Sulla diffusibilità dei latenti ad alta dimensionalità
Gli autoencoder di rappresentazione (RAE) consentono ai modelli di diffusione di operare negli spazi delle caratteristiche degli encoder visivi preaddestrati. Tuttavia, molti encoder disponibili senza

- arXiv
- 2609.28473
- Pubblicato
- 2026-09-23
- Autori
- Chao Feng, Zhiyang Xu, Bowei Chen, Yuanjun Xiong, Xiyao Wang, Jui-Hsien Wang, Richard Zhang, Zhe Lin, Andrew Owens, Yijun Li
Abstract degli autori
Gli autoencoder di rappresentazione (RAE) consentono ai modelli di diffusione di operare negli spazi delle caratteristiche degli encoder visivi preaddestrati. Tuttavia, molti encoder disponibili senza ulteriori modifiche non sono ottimizzati per una ricostruzione fedele e scartano dettagli visivi fini. Come previsto, il fine-tuning di questi encoder per la ricostruzione di immagini consente di recuperare tali dettagli. Tuttavia, forse in modo controintuitivo, questa procedura riduce la dimensionalità effettiva della rappresentazione risultante, e la geometria modificata ha effetti a valle sulla generazione. In particolare, mostriamo che l’uso della consueta predizione della velocità nel flow matching in questo spazio ad alta dimensionalità richiede al modello di adattarsi a direzioni del rumore ortogonali, esterne alla varietà del segnale a bassa dimensionalità, rendendo inefficiente l’ottimizzazione. Questo motiva l’uso della parametrizzazione basata sui dati puliti ($\boldsymbol{x}_{0}$-prediction), che concentra l’apprendimento sulla varietà del segnale sottostante. In esperimenti condotti con diversi encoder dalle elevate capacità di ricostruzione, mostriamo che la $\boldsymbol{x}_{0}$-prediction migliora costantemente le prestazioni nella generazione di immagini da testo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv