Vai al contenuto
AI.info

Ricerca

Distillazione on-policy delle evidenze visive

Gli agenti visivi risolvono problemi alternando il ragionamento alle operazioni sulle immagini. La distillazione on-policy (OPD) offre indicazioni di un modello insegnante potente sulle traiettorie di

Distillazione on-policy delle evidenze visive
arXiv
2609.36838
Pubblicato
2026-09-29
Autori
Shaohang Wei, Feifan Song, Guangyue Peng, Wenhao Yu, Wei Li, Wen Luo, Yang Xu, Yufan Shen, Luke Mao, Yang Du, Asher Qin, Houfeng Wang

Abstract degli autori

Gli agenti visivi risolvono problemi alternando il ragionamento alle operazioni sulle immagini. La distillazione on-policy (OPD) offre indicazioni di un modello insegnante potente sulle traiettorie di interazione generate dallo studente. Tuttavia, le operazioni sulle immagini modificano le evidenze disponibili per il ragionamento successivo: errori locali nell’acquisizione delle evidenze (Acquire), nella loro lettura (Read) o nell’ancoraggio della risposta alle evidenze (Ground) possono quindi propagarsi lungo la traiettoria e portare a risposte errate. I metodi di OPD multimodale esistenti costruiscono o mettono a confronto soprattutto viste ausiliarie dell’immagine originale per rafforzare la supervisione, senza modellare esplicitamente i legami tra le azioni dello studente, le osservazioni che ne risultano e il ragionamento successivo. Questo ne limita la capacità di fornire correzioni mirate alle diverse fasi in cui si verifica un errore. Presentiamo Reflection on Visual Evidence (ReVuE), un metodo di distillazione on-policy per agenti visivi. ReVuE confronta più traiettorie generate dallo studente per la stessa richiesta, riassume le evidenze visive osservate e individua il primo errore nelle fasi Acquire, Read e Ground. Le riflessioni così ottenute forniscono contesto al modello insegnante durante l’addestramento. Raggruppiamo e riponderiamo le perdite di distillazione a livello di token in base a quanto queste riflessioni influiscono sulle previsioni del modello insegnante. In questo modo, la diagnosi delle evidenze a livello di traiettoria diventa una supervisione mirata a livello di token, che guida gli studenti a migliorare l’acquisizione delle evidenze visive e il ragionamento. Su 11 benchmark relativi alle famiglie di modelli Qwen2.5-VL e InternVL3.5, ReVuE supera tutti i metodi OPD di riferimento valutati nei punteggi medi ponderati per percezione, ragionamento matematico e compiti generali. ReVuE riduce inoltre le ridondanze nel ragionamento e nelle chiamate agli strumenti, migliorando al contempo l’accuratezza delle chiamate agli strumenti e delle risposte ai compiti. Il codice è disponibile all’indirizzo https://github.com/sylvain-wei/ReVuE

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv