Vai al contenuto
AI.info

Ricerca

Esplorare la collaborazione tra un agente linguistico e uno non linguistico

Gli LLM sono sempre più impiegati per coordinare, attraverso il linguaggio naturale, agenti specializzati che risolvono compiti complessi. Tuttavia, in molti ambiti importanti, come i giochi e la robo

Esplorare la collaborazione tra un agente linguistico e uno non linguistico
arXiv
2609.00474
Pubblicato
2026-08-31
Autori
Harini S, Somesh Singh, Yaman K Singla, Rajiv Ratn Shah, David Doermann, Balaji Krishnamurthy

Abstract degli autori

Gli LLM sono sempre più impiegati per coordinare, attraverso il linguaggio naturale, agenti specializzati che risolvono compiti complessi. Tuttavia, in molti ambiti importanti, come i giochi e la robotica, gli agenti più efficaci disponibili non sono modelli linguistici. Integrare agenti non linguistici con gli LLM richiederebbe la \emph{verbalizzazione}: comprimere le loro ricche rappresentazioni continue in sintesi testuali ridotte a ogni fase dell’interazione. Per studiare se la verbalizzazione costituisca un collo di bottiglia, presentiamo \textsc{LLAMIA-Bench}, una raccolta di sei diversi compiti collaborativi legati agli scacchi che coprono tre aspetti: imitazione del comportamento, valutazione dello stato e spiegazione in linguaggio naturale. Ogni compito si basa su un problema scacchistico ben noto che né l’LLM né il motore scacchistico possono risolvere da soli. Per affrontare il problema della collaborazione tra LLM e agenti non linguistici, introduciamo l’\emph{internalizzazione dello stato latente}: le rappresentazioni continue dell’agente specializzato vengono proiettate direttamente nella sequenza di token dell’LLM sotto forma di token di stato appresi, con una nuova codifica dinamica man mano che le azioni fanno evolvere lo stato dell’ambiente. Confrontando l’internalizzazione con l’integrazione basata sulla verbalizzazione, i nostri esperimenti rivelano un costante \emph{debito di verbalizzazione}: il divario di prestazioni si amplia durante l’addestramento e persiste quando le dimensioni dell’LLM passano da 4 a 14 miliardi di parametri. Un unico modello da 14 miliardi di parametri, \textsc{LLAMIA}, addestrato con l’internalizzazione dello stato latente, eguaglia o supera, in tutti i compiti del benchmark, i modelli specializzati nei singoli compiti e i modelli di frontiera, tra cui GPT-5.1 con accesso agli strumenti, e generalizza fuori distribuzione dove i modelli sottoposti a fine-tuning per compiti specifici falliscono.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv