Vai al contenuto
AI.info

Ricerca

Dipingi ciò che vedi: valutare la destrezza nell’uso di strumenti visivi da parte degli agenti multimodali

La valutazione si sta spostando dai test statici basati su domande e risposte verso contesti in cui i modelli agiscono tramite strumenti esterni. In questo ambito individuiamo una capacità cruciale ma

Dipingi ciò che vedi: valutare la destrezza nell’uso di strumenti visivi da parte degli agenti multimodali
arXiv
2608.25417
Pubblicato
2026-08-26
Autori
Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

Abstract degli autori

La valutazione si sta spostando dai test statici basati su domande e risposte verso contesti in cui i modelli agiscono tramite strumenti esterni. In questo ambito individuiamo una capacità cruciale ma ancora poco studiata: l’uso di strumenti visivi con destrezza, ossia un’azione visiva parametrizzata, precisa e a ciclo chiuso, in cui i modelli deducono i parametri degli strumenti dalle informazioni visive e tali parametri determinano direttamente il risultato finale. I benchmark esistenti coprono la navigazione sul web, l’uso delle interfacce grafiche e l’ingegneria del software, ma raramente valutano questo nesso tra informazioni visive e precisione di esecuzione. Proponiamo EASEL, un benchmark che valuta un caso controllato di uso di strumenti visivi con destrezza attraverso un compito principale di ricostruzione visiva guidata da un’immagine di riferimento: l’agente dipinge progressivamente una tela per riprodurre l’immagine. EASEL comprende inoltre compiti semantici che riguardano l’annotazione di regioni, la scrittura a mano e la pianificazione di percorsi. Presentiamo anche EASEL-Data, un dataset di 440k campioni organizzato come percorso di apprendimento in due fasi per la supervisione delle traiettorie, ed EASEL-9B, per studiarne l’effetto su questa capacità. La valutazione di 25 modelli rivela che gli attuali agenti multimodali incontrano sistematicamente difficoltà con EASEL. La somiglianza nelle ricostruzioni resta bloccata su livelli bassi (0,40–0,54), mentre l’analisi delle traiettorie mette in luce una grave instabilità a ciclo chiuso: in genere i modelli raggiungono presto un punto di saturazione oppure peggiorano dopo il picco. I compiti semantici evidenziano netti limiti di capacità nell’annotazione precisa e nella pianificazione di percorsi. EASEL-9B, addestrato su EASEL-Data, supera il modello di base del 6,3% in termini relativi, classificandosi terzo tra tutti i modelli valutati.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv