Ricerca
Verifiable Hidden Dynamics Play: generare ambienti di RL per agenti a partire da meccanismi risolti
Gli agenti basati su modelli linguistici si trovano sempre più spesso ad affrontare compiti di lunga durata, con stati che evolvono, decisioni interdipendenti ed esiti ritardati. Per ampliare il loro

- arXiv
- 2609.27321
- Pubblicato
- 2026-09-23
- Autori
- Xinjie Shen, Wei Fan, Xudong Guo, Jianhong Tu, Yang Su, Chuqiao Kuang, Yinger Zhang, Dayiheng Liu
Abstract degli autori
Gli agenti basati su modelli linguistici si trovano sempre più spesso ad affrontare compiti di lunga durata, con stati che evolvono, decisioni interdipendenti ed esiti ritardati. Per ampliare il loro addestramento servono ambienti per agenti diversificati, segnali affidabili sugli esiti e costi contenuti per estenderli. Le pipeline di generazione esistenti costruiscono comunemente un ambiente prima di definire la regola che determina l’esito o di annotarne le traiettorie, lasciando che dinamiche e valutazione vengano allineate a posteriori. VHD-Play inverte questa dipendenza: campiona e risolve un modello matematico prima che un generatore di problemi basato su un corpus traduca il suo processo decisionale in strumenti con stato. Le dinamiche eseguibili e il riferimento per assegnare punteggi alle traiettorie derivano dallo stesso modello risolto. La pipeline produce 3.300 ambienti diversificati per agenti, al costo di pochi centesimi ciascuno. L’addestramento di Qwen3.6-35B-A3B su tre famiglie porta il punteggio medio degli agenti da 0,204 a 0,815 in una valutazione diagnostica su cinque famiglie. I miglioramenti si osservano anche su istanze messe da parte delle tre famiglie di addestramento e su otto famiglie di meccanismi mai viste prima; si estendono poi oltre il substrato generato, raggiungendo benchmark esterni per l’uso generale delle funzioni, la pianificazione dei viaggi e l’e-commerce su 365 giorni. Su E-Commerce Bench, il checkpoint addestrato completa ogni esecuzione senza andare in bancarotta e supera Qwen3.7-Max. Confrontiamo problemi descritti per esteso con versioni dotate di stato, che ne rivelano o nascondono i parametri. Il confronto mostra che gran parte del divario su cui è possibile apprendere riguarda l’interazione con lo stato, non la capacità di risolvere il problema sottostante. Un generatore di problemi da 35B con pesi congelati realizza ambienti più ampi, mentre l’addestramento a scala corrispondente mantiene i miglioramenti all’aumentare delle dimensioni dei meccanismi e dell’orizzonte temporale, indicando il potenziale di un substrato di addestramento in evoluzione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv