Vai al contenuto
AI.info

The Pulse

Microsoft Research mette alla prova Agensh con 1.024 agenti di IA

Un articolo di Microsoft Research riferisce che Agensh ha portato il tasso di superamento dei test di pandoc dal 33,89% con un agente al 55,06% con 1.024 agenti, mentre la media dei risultati su cinque task di ProgramBench è salita dal 19,3

Microsoft Research mette alla prova Agensh con 1.024 agenti di IA

AI.info Team ·

Passare da un agente di IA a 1.024 fa salire dal 33,89% al 55,06% il tasso di superamento dei test riportato per un difficile task di riproduzione software, secondo un nuovo articolo di Microsoft Research. Il risultato è stato ottenuto con Agensh, un’infrastruttura multi-agente progettata per consentire agli agenti di organizzarsi da soli, senza che un pianificatore centrale assegni ogni task.

«Un sistema multi-agente può ridurre la latenza nei task complessi eseguendo il lavoro in parallelo.» — Zhihao Zhan, primo autore, e coautori di Microsoft Research

L’articolo, inviato ad arXiv il 22 settembre 2026, presenta il sistema come una risposta a un collo di bottiglia ricorrente nel software multi-agente: l’orchestratore. In molte configurazioni esistenti, un agente responsabile scompone un obiettivo, assegna il lavoro ad altri agenti e ne combina i risultati. Agensh elimina questo ruolo e mette a disposizione degli agenti strumenti condivisi per decidere cosa fare dopo.

Agensh sostituisce il pianificatore centrale con un’infrastruttura condivisa

Ogni agente di Agensh segue lo stesso ciclo in cinque fasi. Raccoglie lo stato attuale del progetto, prende in carico un sotto-task, lavora con gli strumenti disponibili, verifica il risultato e integra il proprio contributo nell’area di lavoro condivisa. Gli agenti ripetono il ciclo in modo asincrono, senza aspettare che tutti gli altri abbiano finito.

Il sistema si basa su tre componenti infrastrutturali. Un’area di lavoro condivisa conserva il lavoro in corso e le modifiche integrate. Un’interfaccia di messaggistica gestisce gli annunci al team e i messaggi diretti per risolvere sovrapposizioni o dipendenze. Il contesto condiviso conserva risultati riutilizzabili, approcci falliti, sotto-task presi in carico e riepiloghi delle modifiche completate.

Microsoft Research ha realizzato l’area di lavoro con Gitea e il sistema di messaggistica con Mattermost. L’articolo descrive Agensh come uno strato sovrapposto a un’infrastruttura sottostante per singolo agente: il modello continua a gestire il ragionamento locale e l’uso degli strumenti, mentre Agensh si occupa di identità, instradamento degli eventi, stato condiviso, coordinamento e ripristino.

ProgramBench mette alla prova il sistema

I ricercatori hanno valutato Agensh sui cinque task più difficili di ProgramBench, un benchmark di ingegneria del software che chiede agli agenti di riprodurre da zero il comportamento di software di riferimento. L’accesso a Internet è disabilitato e ogni esecuzione ha a disposizione sei ore. I progetti selezionati sono FFmpeg, gromacs, pandoc, PHP-src e ctags.

Questi repository variano molto per dimensioni e finalità. Le basi di codice di riferimento riguardano l’elaborazione multimediale, la simulazione molecolare, la conversione di documenti, l’interpretazione di linguaggi e l’indicizzazione del codice. Il più grande dei cinque, PHP-src, contiene oltre 26.000 file e circa 2,8 milioni di righe di codice nella versione utilizzata per la valutazione.

Con GPT-5.6-sol e l’impostazione high, il tasso medio finale di superamento dei test sui cinque task sale dal 19,31% con un agente al 28,78% con 128 agenti. Si tratta di un aumento di 9,47 punti percentuali, pari a un miglioramento relativo di circa il 49%.

Un gruppo più numeroso raggiunge il risultato migliore

Nell’esperimento più ambizioso, il numero di agenti per pandoc passa da uno a 1.024. Il risultato con un solo agente è del 33,89%, contro il 55,06% ottenuto con 1.024 agenti. A parità di budget di sei ore, il gruppo più numeroso supera il risultato del singolo agente di 21,17 punti percentuali.

Le evidenze raccolte con Agensh riguardano una sola famiglia di benchmark, una sola configurazione del modello e un task software definito con precisione e limitato a sei ore. Gli esperimenti mostrano che aggiungere agenti può migliorare le prestazioni finali, ma non dimostrano che lo stesso andamento al crescere del numero di agenti valga per attività di uso generale o per applicazioni in cui i costi di coordinamento, inferenza e infrastruttura contano più del tempo trascorso.

Il contributo più specifico dell’articolo è architetturale. Tratta il numero di agenti come una variabile sperimentale e mette a disposizione file e messaggi condivisi, oltre a risultati persistenti, invece di un unico responsabile. Nell’esecuzione di pandoc riportata, questa architettura porta il tasso di superamento dei test dal 33,89% con un agente al 55,06% con 1.024 agenti, a parità di budget di sei ore.

Fonte

Esplora

Altri articoli