Vai al contenuto
AI.info

Ricerca

Skill2Env: sintesi di ambienti orientata alle capacità a partire dalle skill per agenti generalisti

Gli ambienti eseguibili sono fondamentali per il post-addestramento degli agenti su compiti che richiedono l’uso di strumenti e interazioni in più passaggi, ma resta difficile costruire su larga scala

Skill2Env: sintesi di ambienti orientata alle capacità a partire dalle skill per agenti generalisti
arXiv
2609.33772
Pubblicato
2026-09-27
Autori
Weiyi Xu, Xiaowen Yang, Wen Da, Hang Xu, Canwei Li, Hongjie You, Pusen Dong, Yucheng Zeng, Zhaokai Luo, Mu Chuan

Abstract degli autori

Gli ambienti eseguibili sono fondamentali per il post-addestramento degli agenti su compiti che richiedono l’uso di strumenti e interazioni in più passaggi, ma resta difficile costruire su larga scala compiti eseguibili insieme ai relativi ambienti. Le skill forniscono conoscenze riutilizzabili in un dominio, procedure operative e istruzioni per l’uso degli strumenti, ma tra le informazioni contenute in una skill e un compito concreto e impegnativo, dotato di un ambiente eseguibile completo, rimane una distanza considerevole. Per colmarla, presentiamo Skill2Env, un framework orientato alle capacità che parte da una skill e usa le capacità richieste all’agente per guidare la sintesi dei compiti e degli ambienti. Skill2Env rappresenta questi requisiti attraverso pattern di difficoltà riutilizzabili e li traduce in schemi di progettazione dei compiti che specificano obiettivi, sfide, fatti relativi all’ambiente, confini delle informazioni e criteri di accettazione. Questi schemi guidano la costruzione congiunta, a partire dalle skill di origine, di istruzioni per i compiti, infrastrutture di esecuzione, spazi di lavoro e valutatori basati su rubriche. Proponiamo inoltre Iterative Task Hardening, che usa le evidenze ricavate dall’esecuzione del risolutore per individuare i compiti progettati in modo non sufficientemente impegnativo, rafforzare o ampliare le relative istanze dei pattern di difficoltà e rivedere gli schemi e gli ambienti corrispondenti. Usando 1,5K traiettorie con punteggi elevati, generate negli ambienti di Skill2Env, per il fine-tuning supervisionato, osserviamo miglioramenti costanti su un’ampia gamma di benchmark per agenti: un risultato che dimostra l’efficacia della sintesi di ambienti orientata alle capacità per il post-addestramento degli agenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv