Ricerca
S3Gym: i LLM possono trasformare l’autoverifica e l’autovalutazione in auto-miglioramento?
I modelli linguistici di grandi dimensioni (LLM) interagiscono sempre più spesso con ambienti esterni e accumulano una notevole esperienza comportamentale, ma i benchmark esistenti per gli agenti li v

- arXiv
- 2608.31100
- Pubblicato
- 2026-08-31
- Autori
- Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) interagiscono sempre più spesso con ambienti esterni e accumulano una notevole esperienza comportamentale, ma i benchmark esistenti per gli agenti li valutano perlopiù come politiche fisse. Resta quindi da capire se un agente possa mettere attivamente alla prova il proprio comportamento, valutare l’esperienza che ne deriva e usarla per migliorare le decisioni future. Presentiamo \textbf{S\textsuperscript{3}Gym}, un benchmark interattivo per valutare l’auto-miglioramento dei LLM attraverso tre capacità collegate: \textbf{Self-Testing}, \textbf{Self-Judging} e \textbf{Self-Improvement}. S$^3$Gym distingue una fase di esplorazione permissiva da una valutazione rigorosa su casi tenuti da parte e applica questo protocollo a sette giochi testuali dotati di verificatori eseguibili dell’ambiente. Valutiamo tre modalità per incorporare l’esperienza acquisita interagendo: History ICL diretto, Summary Memory condizionata dal punteggio e Training dei parametri. I nostri esperimenti mostrano che l’auto-miglioramento non è né automatico né uniforme. L’esperienza a livello di contesto migliora le prestazioni per diverse coppie modello–gioco, ma la modalità più efficace dipende fortemente dalla struttura del compito: i riassunti sono utili quando l’esperienza può essere condensata in regole strategiche riutilizzabili, ma spesso danno risultati inferiori alla cronologia grezza quando il successo dipende da informazioni precise e legate allo stato. Il Training dei parametri produce miglioramenti sostanziali in alcuni compiti, ma in altri mostra anche progressi instabili e un grave trasferimento negativo. Questi risultati indicano che riconoscere le azioni efficaci non basta: gli agenti devono anche trasformare il feedback in politiche eseguibili e trasferibili. S$^3$Gym offre un quadro unificato per analizzare questo processo e individuare gli ostacoli che impediscono agli agenti di trasformare l’esperienza acquisita interagendo in un auto-miglioramento affidabile.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv