Ricerca
HiRAE: autocodifica gerarchica delle rappresentazioni con budget residui
Le rappresentazioni visive preaddestrate permettono di generare immagini, ma potrebbero non conservare pienamente i dettagli più fini necessari per una ricostruzione fedele. Gli strati intermedi dell’

- arXiv
- 2609.37775
- Pubblicato
- 2026-09-29
- Autori
- Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Tengfei Liu, Jing Jin, Yuan Zhou
Abstract degli autori
Le rappresentazioni visive preaddestrate permettono di generare immagini, ma potrebbero non conservare pienamente i dettagli più fini necessari per una ricostruzione fedele. Gli strati intermedi dell’encoder contengono dettagli visivi complementari, ma imparare a fonderli per la ricostruzione può produrre una distribuzione latente difficile da modellare. I metodi di fusione esistenti richiedono di scegliere empiricamente gli strati da usare oppure di ottimizzare in fasi distinte la fusione e la decodifica, aumentando il lavoro di configurazione o la complessità dell’addestramento. Presentiamo HiRAE (Hierarchical Representation Autoencoder), che apprende un sistema di fusione gerarchico sull’intera gerarchia dell’encoder per migliorare la fedeltà della ricostruzione, mantenendo al tempo stesso la compatibilità con la modellazione generativa. HiRAE raggruppa gli strati dell’encoder in base alla profondità e apprende correzioni residue alla rappresentazione più profonda. Limiti alla norma fissati per ciascun gruppo vincolano queste correzioni rispetto all’ancora profonda, con budget più restrittivi per i gruppi meno profondi. HiRAE-24 conserva il numero di token latenti e la dimensione dei canali. Su ImageNet-256, HiRAE-24 riduce il FID della ricostruzione da 0,299 a 0,209 rispetto a RAEv2, mantenendo competitiva la qualità della generazione guidata. Nella generazione di immagini a partire da testo, HiRAE-24 migliora l’allineamento rispetto a RAEv2 su GenEval, DPG-Bench e GenAI-Bench, sia prima sia dopo il fine-tuning supervisionato. A parità di protocollo di addestramento del generatore e di valutazione, il punteggio GenEval dopo il fine-tuning sale da 84,86 a 87,70.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv