Vai al contenuto
AI.info

Ricerca

GraphForge: addestrare agenti operativi con la sintesi di spazi di lavoro ancorata a grafi

Gli agenti operativi devono leggere file di vario tipo, coordinare strumenti e produrre elaborati. Per addestrarli servono compiti costruiti su molti file reali e con risultati verificabili, ma esisto

GraphForge: addestrare agenti operativi con la sintesi di spazi di lavoro ancorata a grafi
arXiv
2609.38923
Pubblicato
2026-09-30
Autori
Qisheng Su, Hanchen Wang, Guanru Zhu, Huicheng Jiang, Qiuyinzhe Zhang, Kou Shi, Zhen Fang, Ziao Zhang, Qingnan Ren, Zehui Chen, Tao Gui, Feng Zhao

Abstract degli autori

Gli agenti operativi devono leggere file di vario tipo, coordinare strumenti e produrre elaborati. Per addestrarli servono compiti costruiti su molti file reali e con risultati verificabili, ma esistono pochi processi capaci di generare dati di questo tipo. I processi esistenti o generano file con modelli, sacrificando realismo e varietà, oppure costruiscono compiti su file reali senza strumenti di verifica specifici per ciascun compito, lasciando incontrollata la qualità dei risultati. Presentiamo GraphForge, un framework basato su un grafo delle evidenze che fonda sia il compito sia la sua verifica su file reali. Partendo da semi legati a professioni per ottenere una varietà controllata, GraphForge allestisce per ciascun seme uno spazio di lavoro con file reali e costruisce un grafo delle evidenze che ne rappresenta le relazioni. Poiché la descrizione del compito e le griglie di valutazione derivano entrambe da questo grafo, i requisiti del compito trovano riscontro nei file dello spazio di lavoro e ogni criterio è ancorato ai file necessari per verificarlo. Una prima esecuzione verifica inoltre che il compito sia realizzabile; prima della raccolta delle traiettorie, un agente di revisione corregge il compito e le griglie di valutazione sulla base dei file originali. Il fine-tuning di Qwen3.6-27B su 2.169 traiettorie di GraphForge porta il punteggio di GDPVal a 1445,7 (+65,7) con OpenHands, e quelli di Workspace-Bench-Lite e SpreadsheetBench II rispettivamente a 63,7 (+7,7) e 24,0 (+13,7) con Claude Code. Il rejection fine-tuning sui rollout prodotti dallo stesso modello SFT, con candidati selezionati tramite le griglie di valutazione ancorate alle evidenze, produce ulteriori miglioramenti in tutti e tre i benchmark, suggerendo che tali griglie forniscano un segnale utile per la selezione. I dati e i modelli sono disponibili.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv