Vai al contenuto
AI.info

Ricerca

Autoevoluzione verificata tramite programmi per i modelli visivo-linguistici

I modelli visivo-linguistici che si autoevolvono si addestrano su domande che generano a partire da immagini prive di etichette. Poiché queste domande non hanno risposte di riferimento, i metodi prece

Autoevoluzione verificata tramite programmi per i modelli visivo-linguistici
arXiv
2609.33855
Pubblicato
2026-09-27
Autori
Ahmed Heakl, Sungik Choi, Moontae Lee, Salman Khan

Abstract degli autori

I modelli visivo-linguistici che si autoevolvono si addestrano su domande che generano a partire da immagini prive di etichette. Poiché queste domande non hanno risposte di riferimento, i metodi precedenti assegnano loro un’etichetta tramite un voto di maggioranza tra le risposte campionate oppure tramite un modello valutatore. In una valutazione umana, rileviamo che il 24\% delle etichette ottenute con il voto di maggioranza e il 18\% di quelle prodotte dal modello valutatore durante l’autoevoluzione sono errate. Per affrontare il problema, presentiamo Verifiable QA Generation for Self-Evolving Models (VQS), che cambia il modo in cui il modello valuta le risposte. Anziché votare su una risposta, il modello analizza ciascuna immagine e la rappresenta in una struttura organizzata, come un grafo della scena, una tabella dei dati di un grafico o un grafo di un diagramma. Programmi prefissati formulano poi una domanda a partire da questa struttura e ne calcolano la risposta. Il modello continua a fungere da verificatore visivo, ma conferma soltanto i singoli fatti utilizzati dal programma, una breve affermazione alla volta. Queste verifiche delle singole affermazioni selezionano gli obiettivi di addestramento del parser, che così migliora anche senza etichette. Secondo i valutatori umani, il 94\% delle risposte di VQS è corretto, contro il 76\% di quelle ottenute con il voto di maggioranza. Su dieci benchmark, VQS migliora i risultati di Qwen3-VL fino a 3,18 punti alle scale 2B, 4B e 8B e, a ciascuna scala, supera la migliore baseline di autoevoluzione. I miglioramenti continuano a crescere nell’arco di tre cicli di addestramento, raggiungendo 3,84 punti alla scala 2B. Il codice è disponibile su https://github.com/ahmedheakl/VQS

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv