Ricerca
Riflessione coordinata bilevel: un approccio basato sulla teoria dei giochi ai sistemi di IA multiagente
I sistemi di IA multiagente basati su LLM usano comunemente un orchestratore per suddividere un compito tra una squadra di agenti esecutori e poi migliorare attraverso la riflessione testuale. Nonosta

- arXiv
- 2609.02750
- Pubblicato
- 2026-09-02
- Autori
- Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo, Jun Wang
Abstract degli autori
I sistemi di IA multiagente basati su LLM usano comunemente un orchestratore per suddividere un compito tra una squadra di agenti esecutori e poi migliorare attraverso la riflessione testuale. Nonostante i solidi risultati empirici, manca una spiegazione unitaria del coordinamento, del miglioramento della memoria e del ruolo della verifica esterna. Modelliamo l’interazione tra orchestratore e agenti esecutori come un gioco di coordinamento bilevel: quando l’accoppiamento è limitato, il gioco degli aggiornamenti locali degli agenti esecutori è un gioco a potenziale approssimato, il cui scostamento dall’equilibrio è determinato dalla qualità della scomposizione. Analizziamo quindi la riflessione come movimento stocastico tra stati semantici della memoria. Per la riflessione in forma libera, ricaviamo un limite superiore a tempo finito, ne dimostriamo l’ottimalità nel caso peggiore e forniamo un limite inferiore positivo sotto una condizione falsificabile di danno persistente. Dimostriamo inoltre un risultato di impossibilità di natura informazionale: nessun filtro che osservi soltanto la trascrizione generata può ottenere un miglioramento uniforme in ambienti indistinguibili sulla base del testo, mentre un filtro ancorato all’ambiente può farlo. Alla luce di questa distinzione, introduciamo Stochastic Reflective Memory Ascent (SRMA), che accetta una memoria candidata solo quando il rischio di valutazione ancorato all’ambiente diminuisce in senso stretto. In presenza di calibrazione e di massa correttiva non degenere, SRMA converge in modo esatto, geometrico o polinomiale; costruzioni corrispondenti mostrano che entrambi i regimi di velocità sono ottimali in ordine di grandezza. Forniamo anche un filtro basato sulla confidenza per la valutazione stocastica e garanzie di riancoraggio per ambienti stazionari a tratti. Gli esperimenti realizzano questi oggetti con metriche ancorate all’ambiente e verificano le leggi previste per il coordinamento e la deriva. Su 500 istanze di SWE-bench, il sistema completo basato su Kimi ne risolve il 72,2%, contro il 70,8% del riferimento pubblico mini-SWE-agent. Codice: https://github.com/YihangChen9/Bilevel-Coordinated-Reflection
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv