Vai al contenuto
AI.info

Ricerca

CompoWorld: espansione composizionale degli ambienti per agenti generalisti

Gli ambienti generati automaticamente offrono una fonte scalabile di dati di interazione per addestrare agenti generalisti. Tuttavia, gli approcci esistenti generano soprattutto compiti all’interno di

CompoWorld: espansione composizionale degli ambienti per agenti generalisti
arXiv
2609.33665
Pubblicato
2026-09-27
Autori
Xiao-Wen Yang, Weiyi Xu, Wen Da, Hang Xu, Canwei Li, Hong-Jie You, Pusen Dong, Yucheng Zeng, Zhaokai Luo, Yu-Feng Li, Yao Hu, Mu Chuan

Abstract degli autori

Gli ambienti generati automaticamente offrono una fonte scalabile di dati di interazione per addestrare agenti generalisti. Tuttavia, gli approcci esistenti generano soprattutto compiti all’interno di un singolo ambiente, mentre i flussi di lavoro reali richiedono agli agenti di collegare informazioni e azioni tra più servizi. Presentiamo Compositional Environment Scaling (\textbf{CompoWorld}), che amplia lo spazio dei compiti combinando una libreria finita di servizi riutilizzabili. Agenti di programmazione trasformano le specifiche degli strumenti in servizi verificati, con stati tipizzati e interfacce condivise, mentre un modello del mondo gestisce gli strumenti che non possono essere implementati in modo affidabile. Una procedura di cammino casuale collega i servizi attraverso grafi delle dipendenze, consentendo di generare e verificare compiti che richiedono il passaggio di informazioni tra servizi. Le traiettorie verificate sono utilizzate per il fine-tuning supervisionato (SFT), mentre il nostro Completion-Focused Rubric Reward orienta l’apprendimento per rinforzo (RL) verso il completamento integrale dei compiti, dando più peso ai criteri con tassi di superamento più bassi all’interno di ciascun gruppo di rollout. Realizziamo 448 servizi che mettono a disposizione 10.130 strumenti e usiamo 3K traiettorie SFT e 1K compiti RL per addestrare Qwen3.6-35B-A3B. I risultati sperimentali mostrano che CompoWorld migliora il modello di base di 9,17 punti in media su otto benchmark. Su AutomationBench supera modelli di punta come Claude Opus 4.6 e si colloca al primo posto tra tutti i modelli 35B-A3B specializzati per agenti inclusi nel confronto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv