Vai al contenuto
AI.info

Ricerca

GenFirst: generazione prima della ricostruzione per una modellazione generativa latente end-to-end stabile

I modelli generativi latenti seguono in genere un processo in due fasi: prima addestrano un autoencoder variazionale per la ricostruzione, poi un modello generativo sullo spazio latente mantenuto fiss

GenFirst: generazione prima della ricostruzione per una modellazione generativa latente end-to-end stabile
arXiv
2608.29335
Pubblicato
2026-08-29
Autori
Guangting Zheng, Yiyuan Zhang, Tao Yang, Yunpeng Chen, Rui Zhu, Jiajun Deng, Yanyong Zhang

Abstract degli autori

I modelli generativi latenti seguono in genere un processo in due fasi: prima addestrano un autoencoder variazionale per la ricostruzione, poi un modello generativo sullo spazio latente mantenuto fisso. Poiché le rappresentazioni latenti ottimizzate per la ricostruzione non sono necessariamente adatte alla generazione, addestrare congiuntamente i due modelli è un’alternativa interessante. L’addestramento end-to-end diretto resta però difficile: è soggetto al collasso delle rappresentazioni latenti e deve affrontare un conflitto tra generazione e ricostruzione. Riesaminiamo il problema analizzando come i diversi obiettivi plasmano lo spazio latente e individuiamo due aspetti fondamentali. Primo, il termine entropico nell’obiettivo basato sulla divergenza di Kullback-Leibler è essenziale per prevenire il collasso: la ricostruzione e l’adattamento alla distribuzione a priori tendono a restringere la distribuzione a posteriori, mentre l’entropia preserva un’incertezza latente non degenere. Secondo, ricostruzione e generazione presentano dinamiche di apprendimento asimmetriche: la ricostruzione è rapida e fortemente supervisionata, mentre la generazione è più lenta e più difficile da ottimizzare. Sulla base di queste osservazioni, realizziamo il primo addestramento end-to-end diretto senza collasso delle rappresentazioni latenti e proponiamo GenFirst, una semplice strategia che antepone la generazione alla ricostruzione. L’obiettivo generativo plasma dapprima lo spazio latente in presenza di una debole pressione della ricostruzione; questa viene poi rafforzata progressivamente per recuperare i dettagli visivi. Convalidiamo GenFirst usando distribuzioni a priori autoregressive continue con verosimiglianze esatte e distribuzioni a priori SiT con verosimiglianze implicite. Con il nostro obiettivo end-to-end e GenFirst, SiT ottiene un gFID di 0,97 con CFG e di 1,45 senza CFG su ImageNet-256, mentre MMDiT raggiunge un punteggio GenEval di 0,90 nella generazione di immagini da testo. Oltre alla generazione di immagini, estendiamo il framework a rappresentazioni latenti visive condivise per la generazione e l’apprendimento delle rappresentazioni, nonché alla generazione unificata continua di testo e immagini. Questi risultati dimostrano che l’apprendimento latente end-to-end stabile è applicabile a diverse distribuzioni a priori generative e modalità.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv