Vai al contenuto
AI.info

Ricerca

AgentWorld: un benchmark per la collaborazione a lungo termine tra agenti basati su LLM

I benchmark multiagente esistenti valutano soprattutto scenari competitivi, interazioni brevi di meno di 20 passaggi oppure si limitano ad aggregare le prestazioni individuali, senza riuscire a isolar

AgentWorld: un benchmark per la collaborazione a lungo termine tra agenti basati su LLM
arXiv
2609.31590
Pubblicato
2026-09-25
Autori
Raphael Shu, Yusen Zhang, Young Min Cho, Jin Mo Yang, Yuan Yuan, Wenliang Zheng, Sharath Chandra Guntuku, Lyle Ungar, Zhou Yu, Rui Zhang

Abstract degli autori

I benchmark multiagente esistenti valutano soprattutto scenari competitivi, interazioni brevi di meno di 20 passaggi oppure si limitano ad aggregare le prestazioni individuali, senza riuscire a isolare e mettere in evidenza le reali capacità di collaborazione degli agenti basati su LLM. Presentiamo AgentWorld, un benchmark composto da 100 compiti annotati da esseri umani, con 100 varianti aumentate, per valutare la collaborazione a lungo termine tra più agenti. I compiti si svolgono nell’arco di 50 o più turni d’interazione in un ricco ambiente sandbox MMORPG e richiedono a 3-20 agenti, con ruoli e capacità asimmetrici, di coordinarsi attraverso la comunicazione, la pianificazione congiunta e la condivisione delle risorse. Il tutto avviene in un contesto a scatola nera, in cui ogni agente agisce indipendentemente, senza accesso agli stati interni degli altri. Per quantificare l’efficacia della collaborazione oltre al tradizionale esito binario dei compiti, proponiamo Causal Collaboration Effectiveness (CCE), una metrica basata su grafi che traccia le dipendenze causali tra le azioni degli agenti e misura quale quota degli sforzi di una squadra abbia effettivamente contribuito al risultato. Gli esperimenti con Gemini 3 Flash, Claude Haiku 4.5, GPT-5 Mini e DeepSeek R1-70B mostrano che persino il modello migliore completa con successo solo il 52,0% dei compiti. Tra le modalità di errore ricorrenti figurano le interruzioni della comunicazione, la confusione dei ruoli e l’incapacità di mantenere piani condivisi da un turno all’altro. AgentWorld è interamente open source.

Leggi il paper originale su arXiv