Ricerca
Apprendere una geometria discriminativa per i Drifting Models
I Drifting Models proposti di recente spostano il raffinamento iterativo della distribuzione dall’inferenza all’addestramento, consentendo una generazione efficace in un solo passaggio. Tuttavia, le l

- arXiv
- 2610.04703
- Pubblicato
- 2026-10-03
- Autori
- Doudou Zhang, Wenwen Hou, Yilin Chen, Qi Chen
Abstract degli autori
I Drifting Models proposti di recente spostano il raffinamento iterativo della distribuzione dall’inferenza all’addestramento, consentendo una generazione efficace in un solo passaggio. Tuttavia, le loro prestazioni su dataset di immagini complessi dipendono fortemente dalla rappresentazione usata per costruire il campo di deriva: la deriva nello spazio dei pixel dà risultati scarsi, mentre gli spazi delle caratteristiche preaddestrati migliorano nettamente la qualità dei campioni, per ragioni ancora poco chiare. Riconduciamo questa differenza alla geometria discriminativa della rappresentazione, che determina la ponderazione dei campioni nella stima della densità con kernel (KDE) e, di conseguenza, la deriva. Introduciamo l’apprendimento persistente delle rappresentazioni, che apprende continuamente una geometria delle rappresentazioni più discriminativa man mano che il generatore evolve da un batch all’altro. Stabiliamo inoltre, a parità di condizioni, un’equivalenza dei gradienti al passo corrente tra la funzione di perdita basata sul rapporto KDE e quella di regressione della deriva. Questo risultato collega l’ottimizzazione del generatore basata sul rapporto tra densità alla deriva empirica e motiva il controllo diretto della velocità di deriva. Su più dataset, il nostro metodo apprende rappresentazioni discriminative efficaci direttamente dai pixel e riduce il FID di circa $82-95\%$ rispetto ai Drifting Models originali nello spazio dei pixel, senza encoder preaddestrati. L’adattamento delle rappresentazioni preaddestrate e l’applicazione del clipping della velocità apportano ulteriori miglioramenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv