Vai al contenuto
AI.info

Ricerca

EdgeGen: migliorare gli agenti che usano strumenti oltre i percorsi senza intoppi, generando casi limite sintetici

Gli agenti basati su LLM che usano strumenti vengono impiegati sempre più spesso nelle applicazioni aziendali. Tuttavia, per una valutazione e un’ottimizzazione efficaci servono dataset di attività di

EdgeGen: migliorare gli agenti che usano strumenti oltre i percorsi senza intoppi, generando casi limite sintetici
arXiv
2609.24115
Pubblicato
2026-09-21
Autori
Harshavardhan Abichandani, Penny Chong, Jiyuan Shen, Gunraj Singh, Ashutosh Hathidara, Marcus Duigan Xing Yu, Jane Lo, Atin Ghosh, Yipeng Li, Daniel Dahlmeier

Abstract degli autori

Gli agenti basati su LLM che usano strumenti vengono impiegati sempre più spesso nelle applicazioni aziendali. Tuttavia, per una valutazione e un’ottimizzazione efficaci servono dataset di attività diversificati e di alta qualità, che spesso è difficile ottenere a causa di vincoli legati alla privacy e di altri fattori. I metodi esistenti per la generazione sintetica di attività producono spesso attività generiche, che ignorano lo stato sottostante dell’agente o il database e non riflettono la varietà degli usi nel mondo reale. Proponiamo EdgeGen, un framework per la generazione sintetica di attività che estrae le regole di conformità dalle specifiche di un agente e le usa per generare attività basate sui dati del database, relative a casi limite e concepite per violare tali regole. In combinazione con le tecniche esistenti di generazione di dati sintetici, EdgeGen permette di migliorare gli agenti tramite fine-tuning e ottimizzazione dell’ambiente di esecuzione. La pipeline risultante costituisce un sistema a ciclo chiuso completamente automatizzato, che non richiede annotazioni umane. Il fine-tuning sui dati generati da EdgeGen produce un miglioramento medio costante dei progressi compreso tra il 2 per cento e il 42 per cento nel dominio delle compagnie aeree di tau2bench, mentre altri metodi di riferimento mostrano un peggioramento per alcuni modelli. Per quanto riguarda invece l’ottimizzazione dell’ambiente di esecuzione, il nostro metodo mostra, per il modello Gemma-4-e4b, un miglioramento medio dei progressi del 10 per cento rispetto agli ambienti curati da esseri umani e del 30 per cento rispetto a quelli di base.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv