Ricerca
ContextPilot: addestrare gli agenti alla gestione proattiva del contesto tramite RL a grana fine
I compiti degli agenti su orizzonti lunghi richiedono ai modelli linguistici di grandi dimensioni (LLM) di recuperare, integrare e conservare informazioni disperse nel corso di interazioni a più turni

- arXiv
- 2608.28476
- Pubblicato
- 2026-08-28
- Autori
- Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun
Abstract degli autori
I compiti degli agenti su orizzonti lunghi richiedono ai modelli linguistici di grandi dimensioni (LLM) di recuperare, integrare e conservare informazioni disperse nel corso di interazioni a più turni. Conservare l’intera cronologia delle interazioni, però, fa crescere continuamente il contesto di lavoro. I recenti metodi di gestione proattiva del contesto consentono ai modelli di modificare il proprio contesto di lavoro con strumenti specializzati, ma presentano ancora tre limiti principali: (1) un insieme di strumenti limitato a ricerca, eliminazione e sintesi, senza supporto per la pianificazione globale, la memoria a lungo termine e la compressione adattiva; (2) un’esplorazione inefficiente, che tratta tutte le azioni di gestione del contesto allo stesso modo nonostante i loro effetti diversi sui risultati finali; e (3) un’attribuzione del merito a grana grossa, che durante l’apprendimento per rinforzo assegna a tutte le azioni intermedie di modifica del contesto la ricompensa finale dell’intera traiettoria. Per colmare queste lacune, presentiamo ContextPilot, un framework di gestione proattiva del contesto per il ragionamento degli agenti su orizzonti lunghi. Il nostro approccio amplia sistematicamente l’insieme di strumenti con strumenti per la pianificazione, la memoria a lungo termine e l’offloading flessibile del contesto. Proponiamo inoltre un metodo di apprendimento per rinforzo pensato per la gestione del contesto: usa le variazioni del contesto e dell’entropia per individuare le decisioni di modifica cruciali per il campionamento delle ramificazioni e stima i vantaggi a livello di singola azione a partire da tutte le traiettorie ramificate che attraversano la corrispondente azione di modifica del contesto. Gli esperimenti su compiti di domande e risposte con contesti lunghi e di ricerca approfondita mostrano che ContextPilot ottiene prestazioni migliori con un contesto di lavoro più compatto, superando costantemente le soluzioni di riferimento esistenti su diversi modelli di base e benchmark. Il codice è disponibile all’indirizzo https://github.com/Tencent/ContextPilot.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv