Ricerca
UniEvo-VL: una procedura di addestramento basata sull’autodistillazione on-policy per l’automiglioramento dei modelli multimodali
I moderni modelli multimodali riuniscono generazione e comprensione in un unico sistema, che permette loro di produrre feedback sul proprio operato e di apprendere da esso. Partendo da questa capacità

- arXiv
- 2609.38721
- Pubblicato
- 2026-09-30
- Autori
- Fang Wu, Da Xing, Yanjie Huang, Junxi Wang, Ji Wang, Hejia Geng, Guancheng Wan, Bowen Zuo, Xiaomin Li, Shixiang Tang, Xinyu Xiang, Zehong Wang, Shiyi Du, Peng Xia, Shuangjia Zheng, Yining Hong, Li Erran Li, Jure Leskovec, Yejin Choi
Abstract degli autori
I moderni modelli multimodali riuniscono generazione e comprensione in un unico sistema, che permette loro di produrre feedback sul proprio operato e di apprendere da esso. Partendo da questa capacità, presentiamo UniEvo-VL, un framework che consente ai modelli multimodali di evolversi autonomamente apprendendo dal feedback costruttivo delle proprie autocorrezioni durante il calcolo in fase di test. Invece di affidarci a un modello insegnante separato, spesso più grande, sfruttiamo le autocritiche dei modelli come informazioni privilegiate e chiediamo a un singolo modello multimodale di svolgere sia il ruolo di insegnante sia quello di studente, in contesti diversi. Lo studente vede soltanto la domanda originale, mentre l’insegnante dispone anche della critica privilegiata. L’addestramento minimizza quindi, per ogni stato, la divergenza tra le loro distribuzioni di diffusione per la rimozione del rumore lungo le traiettorie di campionamento dello studente stesso. Gli esperimenti mostrano che UniEvo-VL migliora le capacità di generazione di immagini dei modelli multimodali, mantenendone la sensibilità a ulteriori informazioni derivanti dalla riflessione. In particolare, partiamo da Qwen-image-2512, open source, e osserviamo un aumento significativo delle prestazioni: da 0,747 a 0,808 su GenEval e da 32,97 a 35,53 su GenEval2 Soft-TIFA. Inoltre, le prove con critici esterni più potenti, come GPT5.6-Luna, indicano che i modelli multimodali con forti capacità di giudizio possono prefigurare un tetto più elevato per la propria evoluzione. Infine, i risultati contrastanti nella resa del testo mostrano che i miglioramenti ottenuti autonomamente potrebbero non essere uniformi tra compiti diversi. Il nostro studio mira a far luce sul filone di ricerca, oggi al centro dell’attenzione, dedicato all’automiglioramento ricorsivo, per migliorare l’esperienza d’uso dei modelli multimodali senza supervisione o indicazioni esterne.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv