Vai al contenuto
AI.info

Ricerca

WEFT: portare su scala il post-training nell’uso degli strumenti per agenti generalisti

I recenti tentativi di portare su scala il post-training nell’uso degli strumenti si sono concentrati soprattutto sulla sintesi di ambienti eseguibili. Questi, però, sono solo una componente di un sis

WEFT: portare su scala il post-training nell’uso degli strumenti per agenti generalisti
arXiv
2609.36887
Pubblicato
2026-09-29
Autori
Bo Mao, Hang He, Linting Wang, Lizhi Lin, Maosen Zhou, Guanming Liu, Jinxiu Liu, Tianyu Huai, Chaoyun Zhang, Bingxuan Li, Kepeng Lei, Guanting Dong, Zhou Shao, Rui Zheng, Hang Yan, Jie Zhou, Chengcheng Wan, Tao Gui, Liang He, Xipeng Qiu

Abstract degli autori

I recenti tentativi di portare su scala il post-training nell’uso degli strumenti si sono concentrati soprattutto sulla sintesi di ambienti eseguibili. Questi, però, sono solo una componente di un sistema più ampio di interazione agentica, che comprende l’ambiente, il compito, l’infrastruttura di esecuzione dell’agente e il valutatore. Ampliare gli ambienti da soli non garantisce miglioramenti proporzionati nelle prestazioni del modello, perché segnali di apprendimento affidabili dipendono da interazioni coerenti tra tutte le componenti del sistema. Per affrontare questo problema, presentiamo WEFT (Whole-system Evolution For Tool-use Post-training), che combina la costruzione su larga scala di sistemi di interazione agentica, l’autoevoluzione guidata dall’esecuzione e un post-training stabile. WEFT amplia la costruzione di questi sistemi lungo tre dimensioni: ampiezza degli ambienti, complessità dei compiti e varietà delle interazioni. L’autoevoluzione guidata dall’esecuzione usa iterativamente le tracce di esecuzione e le evidenze relative allo stato per attribuire i fallimenti e modificare le componenti responsabili; nuovi rollout valutano le modifiche e forniscono evidenze per i successivi cicli di evoluzione. Per garantire un post-training stabile su larga scala, WEFT affronta sia l’affidabilità dell’ottimizzazione sia quella dell’esecuzione: il campionamento che preserva il prefisso conserva i progressi verificati e l’attribuzione del merito per turno atomico circoscrive i segnali di apprendimento, mentre MegaMCP mantiene uno stato isolato e ripristinabile tra rollout simultanei che utilizzano servizi di strumenti condivisi. Numerosi esperimenti su diversi modelli e benchmark dimostrano l’efficacia di WEFT per il post-training nell’uso degli strumenti. WEFT-8B e WEFT-14B superano tutte le baseline valutate di dimensioni comparabili basate sull’ampliamento degli ambienti su BFCL V4, $τ^2$-Bench e Claw-Eval. In particolare, WEFT-14B supera Agent-World-14B di 6,41, 2,23 e 12,27 punti percentuali. WEFT-35B-A3B estende ulteriormente questi miglioramenti a benchmark più impegnativi per flussi di lavoro a lungo orizzonte, tra cui Toolathlon-Verified e AutomationBench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv