Vai al contenuto
AI.info

Ricerca

Modello del mondo con revisione dell’agente: ripensare la modellazione del mondo per gli agenti LLM

I recenti progressi nei modelli linguistici di grandi dimensioni (LLM) hanno permesso agli agenti di affrontare compiti a lungo orizzonte in ambienti diversi. Per migliorare ulteriormente le prestazio

Modello del mondo con revisione dell’agente: ripensare la modellazione del mondo per gli agenti LLM
arXiv
2609.28416
Pubblicato
2026-09-23
Autori
Shuang Sun, Guoxin Chen, Fanzhe Meng, Jia Deng, Huatong Song, Jinhao Jiang, Wayne Xin Zhao, Hongteng Xu, Ji-Rong Wen

Abstract degli autori

I recenti progressi nei modelli linguistici di grandi dimensioni (LLM) hanno permesso agli agenti di affrontare compiti a lungo orizzonte in ambienti diversi. Per migliorare ulteriormente le prestazioni degli agenti, i modelli linguistici del mondo esistenti prevedono in genere le osservazioni dell’ambiente; tuttavia, ricostruire risposte degli strumenti ad alta entropia e dipendenti dall’esecuzione offre un valore limitato quando è disponibile un riscontro reale. Nel frattempo, gli agenti sono soggetti alla \emph{contaminazione dello stato del compito}, per cui supposizioni non supportate e piani obsoleti permangono nella cronologia e distorcono le decisioni successive. Proponiamo l’\textbf{Agent-Editing World Model (AEWM)}, che modella il modo in cui ragionamenti e azioni influenzano i progressi futuri del compito, invece di simulare le risposte degli strumenti. AEWM combina \textbf{Action Judge}, che distingue tra decisioni \textsc{Critical}, \textsc{Exploratory} e \textsc{Noisy}, e \textbf{State Revision}, che modifica continuazioni rumorose di ragionamento--azione basate sulla stessa cronologia osservata. \textbf{EditAct} integra queste capacità con l’esecuzione reale, modificando direttamente lo stato alla base delle decisioni successive anziché limitarsi a fornire critiche. Addestriamo AEWM nei campi della ricerca, del terminale e dell’ingegneria del software attraverso una fase di addestramento intermedia e il fine-tuning supervisionato. AEWM raggiunge un macro-F1 del 70,5\% sul nostro benchmark Action Judge, superando di 10,6 punti il baseline più forte tra i modelli di frontiera. Su sei benchmark e tre modelli di base per agenti, EditAct migliora i punteggi medi di 3,2--6,7 punti rispetto al baseline più forte. Inoltre, il fine-tuning con rejection sampling su traiettorie EditAct verificate, denominato \textbf{AEWM-RFT}, supera Self-RFT di 2,2--2,6 punti in tre domini, senza la guida online di AEWM.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv