Ricerca
Trasferimento adattivo di un prior fuso per la compressione generativa controllabile delle immagini
A bitrate molto bassi, la compressione delle immagini elimina le texture fini e le strutture locali, mentre la ricostruzione orientata alla distorsione produce spesso immagini eccessivamente levigate.

- arXiv
- 2605.16817
- Pubblicato
- 2026-05-16
- Autori
- Yifei Pei, Ying Liu, Nam Ling
Abstract degli autori
A bitrate molto bassi, la compressione delle immagini elimina le texture fini e le strutture locali, mentre la ricostruzione orientata alla distorsione produce spesso immagini eccessivamente levigate. I codec generativi sintetizzano i dettagli mancanti, ma le soluzioni controllabili esistenti basate su codebook si affidano generalmente a prior di ricostruzione fondati su un unico codebook. Proponiamo Adaptive Fused Prior Transfer for Controllable Generative Image Compression (AFP-GIC), che trasferisce un prior fuso adattato all’immagine da un modello AdaCode preaddestrato e congelato. Le caratteristiche del prior sul lato dell’encoder guidano la formazione della rappresentazione latente, mentre il decoder predice un prior fuso compatibile a partire dalla rappresentazione compressa e dalle variabili di controllo, senza trasmettere il prior stesso. Un’analisi preliminare mostra che un migliore allineamento del prior sul lato del decoder restringe un limite superiore dell’errore di ricostruzione e che la famiglia dei prior fusi comprende, come casi particolari, le scelte basate su un unico codebook. Un solo modello preaddestrato supporta cinque punti operativi di bitrate valutati. Nel benchmark unificato, AFP-GIC ottiene una latenza del decoder inferiore del 18,1% e usa 31,10 milioni di parametri per l’inferenza in meno (20,5%) rispetto a DC-VIC. Gli esperimenti su Kodak, CLIC2020 e DIV2K mostrano risultati competitivi in termini di PSNR e SSIM, con i miglioramenti più evidenti nella naturalezza nei punteggi NIQE e nei confronti visivi a bitrate molto bassi. Codice: https://github.com/yifeipet/AFP_GIC.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv