Vai al contenuto
AI.info

Ricerca

OracleZoom: super-risoluzione ricorsiva delle immagini vincolata da riferimenti e ispirata all’autodistillazione on-policy

La super-risoluzione (SR) ricorsiva estende la SR a scala fissa a ingrandimenti estremi, reimmettendo ripetutamente le immagini generate nello stesso modello, come se si ingrandisse più volte un’immag

OracleZoom: super-risoluzione ricorsiva delle immagini vincolata da riferimenti e ispirata all’autodistillazione on-policy
arXiv
2609.06490
Pubblicato
2026-09-06
Autori
Shubhashis Roy Dipta, Sourajit Saha, Shaswati Saha, Nobin Sarwar

Abstract degli autori

La super-risoluzione (SR) ricorsiva estende la SR a scala fissa a ingrandimenti estremi, reimmettendo ripetutamente le immagini generate nello stesso modello, come se si ingrandisse più volte un’immagine. Tuttavia, disporre di dati di riferimento a ogni scala, soprattutto ai livelli più profondi, resta difficile perché la risoluzione richiesta all’immagine di partenza cresce in modo geometrico, lasciando le immagini generate ai livelli più profondi senza supervisione. Presentiamo OracleZoom, un framework ispirato alla distillazione on-policy e vincolato da riferimenti, che si addestra sulla propria traiettoria e porta oltre il limite della supervisione le ultime evidenze di riferimento disponibili. La supervisione diretta e quella tra scale diverse vincolano i contenuti verificabili, mentre un obiettivo di qualità senza riferimento guida la generazione dei dettagli più fini ancora da determinare. Un prior latente preaddestrato e vincolato tramite KL limita la deriva dovuta alla ricerca della qualità, mentre la coerenza EMA stabilizza il limite della supervisione. Su sette dataset, OracleZoom raggiunge una qualità della SR allo stato dell’arte alle diverse scale di ingrandimento, con una media di 0,713 CLIPIQA e miglioramenti maggiori alle scale più profonde, riducendo significativamente le allucinazioni. Codice, dati e modelli sono disponibili all’indirizzo https://dipta007.github.io/OracleZoom/ .

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv