Ricerca
EVOKE: far emergere la conoscenza del mondo negli agenti per prendere decisioni trasferibili
I modelli linguistici di grandi dimensioni (LLM) sono sempre più impiegati come agenti per prendere decisioni in più passaggi, ma trasferiscono con difficoltà le proprie capacità ad ambienti mai visti

- arXiv
- 2609.38334
- Pubblicato
- 2026-09-29
- Autori
- Yuhan Guo, Jinming Liu, Liang Xu, Ziqiang Li, Jianguo Huang, Zhicheng Wang, Hu Zhu, Qiuyu Chen, Yuntao Wei, Xin Jin, Wenjun Zeng
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) sono sempre più impiegati come agenti per prendere decisioni in più passaggi, ma trasferiscono con difficoltà le proprie capacità ad ambienti mai visti. I metodi basati su modelli del mondo affrontano il problema addestrando gli agenti a prevedere le osservazioni future, al prezzo di un addestramento aggiuntivo e di errori che si accumulano quando le previsioni vengono usate per pianificare. Tuttavia, per gli agenti basati su LLM che operano in ambienti digitali, gran parte di questa conoscenza del mondo è già stata interiorizzata durante il preaddestramento: il problema si sposta quindi dall’acquisirla al farla emergere. Sosteniamo che il tipico addestramento successivo eserciti poca pressione in questa direzione, poiché la supervisione basata su un unico obiettivo in ogni stato visitato spinge involontariamente le politiche a fare affidamento su abitudini contestuali superficiali. Presentiamo EVOKE, un metodo di addestramento successivo che esercita questa pressione introducendo obiettivi diversi a parità di stato. Il metodo si ispira a risultati teorici secondo cui un agente capace di perseguire obiettivi diversi deve codificare un modello del mondo ricostruibile dalle sue preferenze tra le azioni. EVOKE mantiene invariati lo stato dell’ambiente e la cronologia delle interazioni e ordina le stesse azioni candidate in base a obiettivi alternativi, costringendo le preferenze tra le azioni a cambiare: una politica che si affidi ad abitudini contestuali o a correlazioni legate a un solo obiettivo non può così ordinarle correttamente. Questo fa emergere implicitamente la conoscenza del mondo acquisita dalla politica durante il preaddestramento, affinché orienti le decisioni. Valutiamo EVOKE su compiti diversi con tre backbone, riscontrando miglioramenti nelle prestazioni sui compiti, nella generalizzazione ad ambienti mai visti e nell’efficienza nell’uso dei dati. Conduciamo inoltre analisi controllate per comprendere meglio da cosa derivino questi miglioramenti. I risultati offrono una nuova prospettiva su come far emergere la conoscenza del mondo interiorizzata per compiere azioni trasferibili attraverso la supervisione diretta delle decisioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv