Ricerca
OSWorld-Science: un benchmark per agenti che apprendono e usano software scientifici
I software scientifici rappresentano un banco di prova impegnativo per gli agenti che usano il computer basati su modelli visivo-linguistici (VLM): completare un flusso di lavoro di ricerca richiede d

- arXiv
- 2609.39903
- Pubblicato
- 2026-09-30
- Autori
- Dingyuan Dai, Heli Qi, Lei Liu, Yinxi Li, Baiding Chen, Zijun Dou, Qingcheng Zeng, Qi Kang, Oliver Sun, Eric Wang, Bo Zhou, Haixin Wang, Yufan Du, Shi Bo, Ruihan Lin, Mengqi Yuan, Dunjie Lu, Steven Dillmann, Yiming Shi, Tina Su, Amy Xin, Minghao Liu, Xi Wang, Xu Huang, Ge Zhang, Pengyu Nie, Zhen Yang, Jie Tang, Juanzi Li, Weihao Xuan, Tianyu Liu
Abstract degli autori
I software scientifici rappresentano un banco di prova impegnativo per gli agenti che usano il computer basati su modelli visivo-linguistici (VLM): completare un flusso di lavoro di ricerca richiede di interpretare interfacce specialistiche, manipolare oggetti scientifici e produrre risultati verificabili. Presentiamo quindi OSWorld-Science, un benchmark e un ambiente di valutazione che combinano compiti scientificamente significativi, una valutazione basata sugli artefatti prodotti e un’infrastruttura efficiente per studiare l’uso del computer in ambito scientifico. Il benchmark comprende 12 VLM e 146 compiti di alta qualità, distribuiti tra diversi ambiti scientifici e configurazioni software, e copre flussi di lavoro quali il disegno di molecole e la retrosintesi, l’analisi di immagini patologiche, il calcolo statistico e la simulazione fisica. I compiti sono sviluppati a partire da proposte di esperti e attraverso una co-progettazione iterativa tra esseri umani e IA; la selezione è guidata dal valore scientifico e dalla difficoltà. Valutatori specifici per ciascun compito, basati sull’esecuzione, esaminano lo stato delle applicazioni e gli artefatti generati, tra cui strutture molecolari, maschere di segmentazione, grafici e risultati numerici, e attribuiscono punteggi parziali ai risultati incompleti. La nostra infrastruttura dedicata integra adattatori per i modelli, controllo del ciclo di interazione e registrazione delle traiettorie, per consentire il confronto tra modelli e strategie di interazione. I risultati mostrano che gli attuali VLM più avanzati, anche con un’infrastruttura robusta, incontrano ancora difficoltà nell’affrontare questioni fondamentali negli ambiti scientifici. Analizziamo inoltre i risultati del benchmark in relazione agli aspetti multilinguistici, agli sforzi di ragionamento, alla lunghezza del contesto e ad altri fattori, e ne ricaviamo diverse conclusioni e indicazioni importanti per lo sviluppo futuro. Nel complesso, forniamo un quadro integrato che collega obiettivi scientifici definiti da esperti a risultati verificabili ottenuti tramite software, consentendo una valutazione sistematica sia delle capacità degli agenti sia della progettazione dell’infrastruttura nei flussi di lavoro scientifici.