Ricerca
Editing visivo guidato dal ragionamento
I grandi modelli multimodali (LMM) hanno compiuto progressi significativi nella comprensione e nella generazione visiva, ma incontrano ancora difficoltà nell’editing visivo, in particolare nel seguire
- arXiv
- 2610.12343
- Pubblicato
- 2026-10-08
- Autori
- Xue Yang, Peiyuan Zhang, Yilun Zhu, Qihao Yang, Mingxin Liu, Xiangyu Zhao, Ziqian Fan, Zhaokai Wang, Yan Li, Yifan Yang, Xu Yang, Xiaosong Jia, Yue Zhou, Zhihang Zhong, Junchi Yan
Abstract degli autori
I grandi modelli multimodali (LMM) hanno compiuto progressi significativi nella comprensione e nella generazione visiva, ma incontrano ancora difficoltà nell’editing visivo, in particolare nel seguire istruzioni complesse, preservare la coerenza dell’aspetto e supportare formati di input flessibili. Per studiare questa lacuna, presentiamo RISEBench, il primo benchmark per valutare l’editing visivo guidato dal ragionamento (RISE), e lo estendiamo a RISEBench++, un benchmark più completo e dettagliato per questo compito emergente. RISEBench++ sviluppa la tassonomia in una struttura gerarchica articolata in sei dimensioni del ragionamento: temporale, causale, spaziale, logico e controfattuale, oltre al ragionamento ibrido, che integra più tipi di ragionamento in modifiche effettuate in più turni. Queste dimensioni sono ulteriormente suddivise in 12 sottocategorie e 65 tipi di compiti specifici. Ampliamo i formati di input includendo il condizionamento basato su più immagini e portiamo il benchmark a 1.000 casi di test annotati da esseri umani, pubblicati in inglese e in cinese. Miglioriamo inoltre il nostro sistema di valutazione, esaminando il ragionamento sulle istruzioni, la coerenza dell’aspetto e la plausibilità visiva con valutatori umani e un approccio che impiega un LMM come valutatore, per ottenere giudizi più affidabili e calibrati. Oltre al benchmark, presentiamo RISE-Agent, un framework agentico che non richiede addestramento e integra pianificazione guidata dal ragionamento, esecuzione assistita da strumenti e perfezionamento guidato da un verificatore, superando la maggior parte dei migliori approcci esistenti in diversi compiti RISE. Valutiamo 58 approcci all’editing visivo, tra cui 34 modelli open source, 19 modelli closed source e 5 metodi agentici. I risultati rivelano difficoltà sostanziali nell’editing visivo basato sul ragionamento: persino l’approccio più efficace tra quelli valutati, GPT-Image-2.5 Sunburst, raggiunge un’accuratezza di appena il 56,6%. RISEBench++ mette in luce i limiti degli attuali modelli di editing, offre spunti di analisi e indica direzioni future per l’editing visivo consapevole del ragionamento.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv