Vai al contenuto
AI.info

Ricerca

PILOT nel ciclo: auto-miglioramento in tempo reale per agenti su orizzonti lunghi

Le esecuzioni degli agenti su orizzonti lunghi generano esperienze che possono migliorare sia l’esecuzione in corso sia le attività future. La maggior parte dei metodi di auto-miglioramento elabora qu

PILOT nel ciclo: auto-miglioramento in tempo reale per agenti su orizzonti lunghi
arXiv
2608.26530
Pubblicato
2026-08-27
Autori
Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan, Yao Hu, Wenjie Li, Chengyue Jiang

Abstract degli autori

Le esecuzioni degli agenti su orizzonti lunghi generano esperienze che possono migliorare sia l’esecuzione in corso sia le attività future. La maggior parte dei metodi di auto-miglioramento elabora queste esperienze solo al termine dell’esecuzione: non può quindi reindirizzare l’esecuzione in corso né applicare e verificare immediatamente quanto appreso. Sosteniamo invece che l’auto-miglioramento debba avvenire in tempo reale, usando le esperienze man mano che emergono sia per reindirizzare l’esecuzione in corso sia per aggiornare l’harness persistente. Le architetture esistenti per gli agenti non supportano pienamente questo obiettivo. Nell’autocorrezione di un singolo agente, l’esecuzione del compito e la valutazione della traiettoria avvengono nello stesso contesto; la delega a un sottoagente separa invece l’esecuzione, ma in genere non consente di reindirizzare un sottoagente mentre è attivo. Presentiamo PILOT, un harness con supervisore e agente esecutore che consente l’auto-miglioramento in tempo reale attraverso due meccanismi collegati: (1) l’orientamento in tempo reale permette a un supervisore separato di reindirizzare o interrompere l’agente esecutore durante l’esecuzione; (2) l’autoevoluzione in tempo reale trasforma le procedure e le modalità di errore emerse durante l’esecuzione in competenze e memoria riutilizzabili. Su due backbone congelati e tre benchmark, PILOT si colloca al primo posto in cinque configurazioni su sei. Su Terminal-Bench 2.0, PILOT supera gli harness corrispondenti di un massimo di 9,8 punti percentuali. Nello scenario di auto-miglioramento, PILOT guadagna 14,6 punti con GLM-5.1 e 12,4 punti con Kimi-K2.6. Il numero medio di token in output diminuisce rispettivamente del 42,9% e del 47,4%, mentre le valutazioni riuscite per milione di token in output aumentano rispettivamente del 110,3% e del 134,0%.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv