Vai al contenuto
AI.info

Ricerca

Sulla diffusibilità dei latenti ad alta dimensionalità

Gli autoencoder di rappresentazione (RAE) consentono ai modelli di diffusione di operare negli spazi delle caratteristiche degli encoder visivi preaddestrati. Tuttavia, molti encoder disponibili senza

Sulla diffusibilità dei latenti ad alta dimensionalità
arXiv
2609.28473
Pubblicato
2026-09-23
Autori
Chao Feng, Zhiyang Xu, Bowei Chen, Yuanjun Xiong, Xiyao Wang, Jui-Hsien Wang, Richard Zhang, Zhe Lin, Andrew Owens, Yijun Li

Abstract degli autori

Gli autoencoder di rappresentazione (RAE) consentono ai modelli di diffusione di operare negli spazi delle caratteristiche degli encoder visivi preaddestrati. Tuttavia, molti encoder disponibili senza ulteriori modifiche non sono ottimizzati per una ricostruzione fedele e scartano dettagli visivi fini. Come previsto, il fine-tuning di questi encoder per la ricostruzione di immagini consente di recuperare tali dettagli. Tuttavia, forse in modo controintuitivo, questa procedura riduce la dimensionalità effettiva della rappresentazione risultante, e la geometria modificata ha effetti a valle sulla generazione. In particolare, mostriamo che l’uso della consueta predizione della velocità nel flow matching in questo spazio ad alta dimensionalità richiede al modello di adattarsi a direzioni del rumore ortogonali, esterne alla varietà del segnale a bassa dimensionalità, rendendo inefficiente l’ottimizzazione. Questo motiva l’uso della parametrizzazione basata sui dati puliti ($\boldsymbol{x}_{0}$-prediction), che concentra l’apprendimento sulla varietà del segnale sottostante. In esperimenti condotti con diversi encoder dalle elevate capacità di ricostruzione, mostriamo che la $\boldsymbol{x}_{0}$-prediction migliora costantemente le prestazioni nella generazione di immagini da testo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv