Vai al contenuto
AI.info

Ricerca

CERA-MoA: meccanismi di instradamento che coevolvono con agenti LLM in apprendimento continuo

Gli attuali paradigmi Mixture-of-Agents (MoA) trattano generalmente l’instradamento delle richieste e il fine-tuning degli agenti come processi separati, limitando la propria capacità di rispondere al

CERA-MoA: meccanismi di instradamento che coevolvono con agenti LLM in apprendimento continuo
arXiv
2609.18779
Pubblicato
2026-09-16
Autori
Jiaxuan Jiang, Liyuan He, Zhixuan Fang

Abstract degli autori

Gli attuali paradigmi Mixture-of-Agents (MoA) trattano generalmente l’instradamento delle richieste e il fine-tuning degli agenti come processi separati, limitando la propria capacità di rispondere all’evoluzione delle capacità degli agenti. Questa separazione impedisce alle strategie di instradamento di adattarsi all’evoluzione delle capacità degli agenti durante il post-training e agli agenti di sviluppare una specializzazione sinergica basata sui dati. Per superare questo limite, presentiamo CERA-MoA (Co-Evolving Router with continually learning Agents for Mixture-of-Agents), un framework iterativo di apprendimento per rinforzo in cui il router dinamico e le policy indipendenti degli agenti coevolvono. Progettiamo uno stimatore predittivo del grado di familiarità che sfrutta gli stati nascosti dei livelli intermedi per valutare la competenza semantica dei diversi agenti, evitando il costo dei rollout completi. Sulla base di questi punteggi di familiarità, un meccanismo di instradamento adattivo a soglia cumulativa attiva dinamicamente un sottoinsieme minimo di agenti selezionato per il compito, bilanciando prestazioni ed efficienza. Assegnando in modo proattivo agli agenti campioni di addestramento mirati in base all’evoluzione delle loro competenze, CERA-MoA favorisce la differenziazione delle capacità. Ampi esperimenti in vari ambiti dimostrano che CERA-MoA supera le baseline allo stato dell’arte basate sull’instradamento tra agenti statici e sul fine-tuning con un flusso di lavoro fisso.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv