Vai al contenuto
AI.info

Ricerca

MILO: scoperta automatizzata delle strutture di controllo tramite evoluzione orchestrata multiagente

I moderni sistemi basati su agenti combinano un modello di IA con una struttura di controllo che governa l’esecuzione e le interazioni con l’ambiente. La progettazione di questa struttura incide forte

MILO: scoperta automatizzata delle strutture di controllo tramite evoluzione orchestrata multiagente
arXiv
2609.38349
Pubblicato
2026-09-29
Autori
Prithwish Jana, Mononito Goswami, Hao Liu, Xinyu Li, Langlin Huang, Zhehui Huang, Zhishen Huang, Patrick Blöbaum, Anoop Deoras, Purak Jain, Nikos Kanakaris, Sahika Genc

Abstract degli autori

I moderni sistemi basati su agenti combinano un modello di IA con una struttura di controllo che governa l’esecuzione e le interazioni con l’ambiente. La progettazione di questa struttura incide fortemente sulle prestazioni su orizzonti temporali lunghi, ma l’esplorazione del suo spazio combinatorio richiede un notevole lavoro umano, da ripetere ogni volta che i modelli cambiano. I metodi automatizzati esistenti esplorano questo spazio in modo limitato: ottimizzano soltanto componenti come prompt o abilità, oppure rimangono intrappolati in strategie di ricerca fisse e orientate allo sfruttamento delle soluzioni già individuate. Presentiamo MILO (Meta-evolutionary Island Orchestration), un framework che fa coevolvere le strutture di controllo degli agenti e la strategia impiegata per scoprirle. MILO combina: (i) una memoria gerarchica delle linee di discendenza in alberi organizzati per isole, che usa le mutazioni scartate come evidenza negativa; (ii) agenti che generano mutazioni per ciascuna isola, riscrivendo intere strutture di controllo sulla base della storia globale della ricerca e di riscontri specifici sul progenitore; e (iii) un orchestratore che adatta la ricerca mediante l’innesto di linee di discendenza e la speciazione, la riassegnazione degli agenti che generano mutazioni e la revisione del curriculum. Su Terminal-Bench 2.1, PaperBench e DeepSWE, le strutture di controllo scoperte da MILO superano otto strutture di controllo e sei metodi di ricerca all’avanguardia, sia con modelli di frontiera (Opus 4.8) sia con modelli dai pesi aperti (gpt-oss-120b). Con Opus 4.8, MILO migliora la risoluzione rispetto alla propria struttura di controllo iniziale rispettivamente di $+12.0\%$, $+28.3\%$ e $+10.3\%$, a fronte di miglioramenti massimi ottenuti dai precedenti metodi di ricerca pari a $+4.5\%$, $+18.3\%$ e $0\%$. Su Terminal-Bench 2.1 raggiunge $86.1 \pm 2.0\%$, superando il primo classificato nella classifica ufficiale ($83.8 \pm 2.3\%$) e usando il 26\% di token in meno rispetto alla propria struttura di controllo iniziale. Sui problemi aperti di EinsteinArena, MILO migliora i migliori limiti superiori noti per la sovrapposizione minima di Erdős ($0.3808586 \to 0.3808568$) e per la prima e la terza disuguaglianza di autocorrelazione ($1.50274365 \to 1.50274360$; $1.45081 \to 1.44889$).

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv