Vai al contenuto
AI.info

Ricerca

Il raffinamento è intrinsecamente modificabile: editing delle immagini da prompt a prompt senza addestramento con Generative Refinement Network

L’editing delle immagini guidato dal testo deve introdurre le modifiche richieste preservando i contenuti originali non correlati. Nell’editing senza addestramento, gli editor basati sulla diffusione

Il raffinamento è intrinsecamente modificabile: editing delle immagini da prompt a prompt senza addestramento con Generative Refinement Network
arXiv
2609.20633
Pubblicato
2026-09-17
Autori
Yulong Chen, Ziqian Zhang, Haoyu Zhang, Ao He, Yaxing Wang, Senmao Li, Kai Wang

Abstract degli autori

L’editing delle immagini guidato dal testo deve introdurre le modifiche richieste preservando i contenuti originali non correlati. Nell’editing senza addestramento, gli editor basati sulla diffusione ricorrono spesso a controlli spaziali le cui imprecisioni possono rendere incomplete le modifiche o alterare regioni non correlate. Gli editor causali autoregressivi devono affrontare un ulteriore vincolo: l’ordine di decodifica fisso limita la possibilità di rivedere le decisioni precedenti. Siamo i primi a esplorare l’editing di immagini senza addestramento con Generative Refinement Networks (GRN) e osserviamo che il loro processo di raffinamento è intrinsecamente adatto all’editing e offre una modalità promettente per affrontare queste limitazioni. Partendo da questa osservazione, presentiamo RefineEdit, un framework senza addestramento per l’editing delle immagini da prompt a prompt basato su GRN. La nostra idea chiave consiste nell’abbinare la localizzazione delle modifiche alla generazione dei contenuti tramite il raffinamento globale dei codici binari dell’immagine, consentendo di rivedere gli indizi utili all’editing man mano che l’immagine evolve. Più nello specifico, RefineEdit combina l’instradamento dei bit con due meccanismi di stabilizzazione: il congelamento spaziale adattivo e il blocco finito dei bit. L’instradamento dei bit parte da uno stato sorgente intermedio e utilizza le differenze di probabilità con segno tra i due rami per individuare le posizioni e i bit modificabili. Indirizza i bit selezionati verso il raffinamento delle modifiche, mentre ancora gli altri alla traiettoria evolutiva della sorgente. Il congelamento spaziale adattivo limita l’espansione non necessaria dell’area di modifica, mentre il blocco finito dei bit mantiene le attivazioni recenti dei bit per favorire la prosecuzione dell’editing. Il framework nel suo complesso non richiede ulteriore addestramento, maschere esterne né controllo dell’attenzione. Nelle nove categorie di editing di PIE-Bench, RefineEdit ottiene i migliori punteggi di preservazione dello sfondo in PSNR, LPIPS, MSE e SSIM, oltre ai punteggi CLIP più alti per l’intera immagine e per la regione modificata tra i metodi valutati. Il codice è disponibile all’indirizzo https://github.com/mura1n/RefineEdit.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv