Ricerca
X-Tree: tokenizzare l’esperienza riutilizzabile per una generalizzazione efficiente degli agenti
Gli agenti che svolgono compiti in più passaggi vengono addestrati su sequenze lineari di azioni: SFT e RLVR attribuiscono lo stesso peso a ogni token e ignorano le sottoprocedure che ricorrono in com

- arXiv
- 2609.32993
- Pubblicato
- 2026-09-26
- Autori
- Sitao Cheng, Xunjian Yin, Zhiyuan Sun, Yuxuan Li, Ruiwen Zhou, Xiangru Jian, Victor Zhong
Abstract degli autori
Gli agenti che svolgono compiti in più passaggi vengono addestrati su sequenze lineari di azioni: SFT e RLVR attribuiscono lo stesso peso a ogni token e ignorano le sottoprocedure che ricorrono in compiti diversi, cioè la gerarchia che permette agli esseri umani di pianificare dall’alto verso il basso a partire da routine riutilizzabili. Questa struttura rimane inutilizzata e l’addestramento su sequenze lineari sfrutta ogni traiettoria, già scarsa, meno di quanto il suo contenuto consentirebbe. Gli agenti recenti usano questa struttura, ma solo come skill scritte da LLM e inserite nel contesto, mai nei pesi del modello: i benefici non si generalizzano quindi oltre il recupero delle skill. Noi, invece, ricaviamo la gerarchia dai dati stessi e la usiamo per l’addestramento, senza chiamate a LLM. Seguendo l’esempio dei tokenizzatori di testo, che costruiscono un vocabolario basandosi soltanto sui conteggi, valutiamo i segmenti di azioni in base alla loro riutilizzabilità e aggreghiamo azioni canonizzate in un albero dell’esperienza riutilizzabile (X-Tree). Ogni nodo di X-Tree rappresenta come una skill frequente e associata al successo si compone di sottoskill, favorendo una generalizzazione efficiente. Integriamo X-Tree in tre modalità di addestramento: RL offline, in cui ogni nodo è un’istanza di addestramento; RLVR online, con un bonus adattivo per le skill; e autodistillazione on-policy, in cui X-Tree costituisce il contesto privilegiato del modello che funge da insegnante di sé stesso. Su WebArena, ScienceWorld e WebShop, con modelli di tre dimensioni diverse, X-Tree migliora i risultati rispetto alle procedure standard, a parità di dati e budget, fino al 4,5% di SR su WebArena, al 5,8% di SR su ScienceWorld e al 4,1% di successi su WebShop. Analisi a parità di condizioni attribuiscono questi miglioramenti alla struttura di X-Tree e alle tre modalità di integrazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv