Ricerca
AutoRef: ottimizzazione dell’harness per la generazione agentica di immagini a partire da più riferimenti
I recenti modelli di generazione delle immagini possono ricevere più immagini di riferimento e combinarle in una nuova immagine. La generazione a partire da più riferimenti resta tuttavia difficile: i

- arXiv
- 2609.35530
- Pubblicato
- 2026-09-28
- Autori
- Yuta Oshima, Ku Onoda, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta
Abstract degli autori
I recenti modelli di generazione delle immagini possono ricevere più immagini di riferimento e combinarle in una nuova immagine. La generazione a partire da più riferimenti resta tuttavia difficile: i modelli possono omettere o duplicare i soggetti presenti nei riferimenti, oppure produrre immagini in cui più soggetti sembrano innaturalmente incollati. Lavori recenti hanno proposto agenti per la generazione di immagini che combinano modelli di generazione delle immagini, modelli di ragionamento e un harness: un programma eseguibile che definisce come vengono interpretate le immagini di riferimento, come avviene la generazione, come vengono analizzati i risultati e come viene scelta l’immagine finale. Nella generazione a partire da più riferimenti, però, i riferimenti hanno ruoli diversi e i risultati devono soddisfare contemporaneamente molti criteri, tra cui la fedeltà a ciascun riferimento e la naturalezza dell’immagine nel suo insieme. Si potrebbero quindi migliorare molte parti dell’harness, dal modo in cui vengono elaborati i riferimenti a quello in cui vengono analizzati i risultati. È perciò difficile prevedere quali modifiche miglioreranno le prestazioni e in quale misura, ed è difficile progettare a mano un buon harness; in effetti, le prestazioni degli harness scritti da esseri umani variano notevolmente. Proponiamo dunque AutoRef, che ottimizza automaticamente l’harness mantenendo invariati entrambi i modelli: un agente di programmazione ne riscrive iterativamente il codice. AutoRef separa i compiti il cui feedback orienta le proposte da quelli usati per selezionare i candidati, e prosegue la ricerca a partire da un beam degli harness meglio classificati nei compiti di selezione. Con questa procedura otteniamo AutoRef-Harness, che migliora il punteggio del modello a pesi aperti FLUX.2 [klein] 4B da 5,72 a 7,37 su compiti con quattro riferimenti del benchmark MultiBanana non usati durante l’ottimizzazione, eguagliando o superando modelli proprietari tra cui Nano Banana Pro e GPT-Image-1.5. Senza una nuova ottimizzazione, lo stesso harness migliora i risultati anche quando il generatore, il numero di riferimenti, il benchmark, il valutatore o il modello di ragionamento sono diversi da quelli usati nella ricerca.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv