Vai al contenuto
AI.info

Ricerca

E-Commerce Bench: valutare gli agenti basati su LLM nella gestione autonoma di un’impresa nel lungo periodo

I compiti svolti dagli agenti nel lungo periodo non si riducono a concatenare compiti brevi in un maggior numero di turni di interazione. I loro ambienti dinamici in evoluzione e le dipendenze a lungo

E-Commerce Bench: valutare gli agenti basati su LLM nella gestione autonoma di un’impresa nel lungo periodo
arXiv
2608.30730
Pubblicato
2026-08-31
Autori
Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

Abstract degli autori

I compiti svolti dagli agenti nel lungo periodo non si riducono a concatenare compiti brevi in un maggior numero di turni di interazione. I loro ambienti dinamici in evoluzione e le dipendenze a lungo raggio richiedono ai modelli linguistici di grandi dimensioni (LLM) di esplorare continuamente, imparare dall’esperienza e adattare le proprie strategie nell’arco di migliaia di passaggi. Presentiamo E-Commerce Bench, il primo benchmark open source che integra negoziazioni in più turni con le controparti ed eventi dinamici nella gestione di un’impresa per un anno. Nell’arco di 365 giorni, un agente basato su LLM gestisce contemporaneamente più negozi online: studia il mercato, negozia con i fornitori per procurarsi le scorte, ottimizza le strategie di vendita, evade gli ordini, gestisce i resi e amministra il flusso di cassa per massimizzare le attività totali a fine anno. Per costruire un ambiente operativo realistico dal punto di vista del venditore, i dati sui prodotti e sui fornitori sono ricavati da una vera piattaforma di commercio elettronico, mentre un calendario annuale di promozioni, calamità naturali e shock della catena di approvvigionamento modifica continuamente la domanda. Per garantire la riproducibilità, entrambi i versanti del mercato sono deterministici: gli acquisti e i resi dei clienti seguono un modello di domanda fisso, mentre un meccanismo di negoziazione determina i prezzi, le concessioni e le decisioni dei fornitori; un LLM viene usato soltanto per esprimerli a parole. Valutiamo 18 modelli all’avanguardia secondo sette dimensioni, tra cui le attività a fine anno, e riscontriamo che nessun modello prevale su tutti gli altri. GPT-5.6 Sol ottiene i guadagni più elevati, portando il capitale iniziale di 100.000 a 1.431.425, ma si colloca al 16° posto su 18 nella prevenzione delle frodi ed è meno efficiente sul piano operativo di Fable5. Tra i modelli a pesi aperti, Qwen3.8-Max-Preview è primo con 416.252, il 38% in più rispetto a GLM 5.2 (high), e mostra la maggiore capacità di apprendimento nel corso dell’intero periodo, negoziando prezzi via via più bassi su ordini successivi. Il nostro codice è disponibile su https://github.com/QwenLM/E-CommerceBench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv