Ricerca
Ricerca dinamica degli harness: costruire sistemi multiagente per ogni query mediante previsioni
Gli harness per agenti definiscono i ruoli, le istruzioni, gli strumenti e la struttura delle comunicazioni usati per risolvere un compito, e l’harness più adatto dipende dalla query. Poiché il valore

- arXiv
- 2610.04137
- Pubblicato
- 2026-10-02
- Autori
- Som Sagar, Shasha Li, Hejie Cui, Ransalu Senanayake, Sercan Ö. Arık
Abstract degli autori
Gli harness per agenti definiscono i ruoli, le istruzioni, gli strumenti e la struttura delle comunicazioni usati per risolvere un compito, e l’harness più adatto dipende dalla query. Poiché il valore di ogni scelta progettuale è osservabile solo attraverso l’esecuzione, adattare un harness a ciascuna query ha finora richiesto di eseguire soluzioni alternative al momento dell’inferenza oppure un costoso lavoro di progettazione manuale. Presentiamo SHIFT, che sposta l’esecuzione fuori dal ciclo di ricerca per ciascuna query. Un LLM locale con il ruolo di architetto apprende dalla ricerca una policy per le azioni di costruzione degli harness e, sulla base delle esecuzioni misurate, una funzione di valore che predice un’utilità capace di bilanciare accuratezza e costo di esecuzione. Per ogni query, una ricerca ad albero Monte Carlo usa queste previsioni per costruire un harness. Su 9.193 compiti in sei benchmark, dalla matematica ai compiti sui documenti e a quelli per assistenti generalisti, con Gemini 3.5 Flash come esecutore, SHIFT raggiunge la più alta accuratezza media, circa l’80%, superando 17 baseline che comprendono il prompting, l’ottimizzazione dei prompt e la ricerca di workflow, e distaccando la migliore baseline di 7,2 punti percentuali. Anche una modalità meno costosa di SHIFT raggiunge un’accuratezza media superiore a quella di tutte le baseline, usando il 32% di token in meno nell’esecuzione rispetto alla migliore baseline. Mostriamo inoltre che scegliere congiuntamente struttura, istruzioni e strumenti dà risultati migliori rispetto a scegliere soltanto le istruzioni o soltanto gli strumenti, con un vantaggio fino a 9,1 punti percentuali, e che la selezione tramite una funzione di valore appresa individua, tra gruppi di candidati, harness più accurati e con un costo di esecuzione inferiore.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv