Ricerca
StudentSim: addestrare simulatori di studenti basati su LLM
I tutor basati sull’IA sono più utili quando si adattano ai punti di forza e di debolezza di ciascuno studente e al tipo di guida che preferisce. Ma i dati su quali indicazioni funzionino per quali st

- arXiv
- 2609.01591
- Pubblicato
- 2026-09-01
- Autori
- Ke Yang, Chenglong Wang, Michel Galley, Chandan Singh, Jeevana Priya Inala, ChengXiang Zhai, Jianfeng Gao
Abstract degli autori
I tutor basati sull’IA sono più utili quando si adattano ai punti di forza e di debolezza di ciascuno studente e al tipo di guida che preferisce. Ma i dati su quali indicazioni funzionino per quali studenti sono scarsi, e raccoglierli da studenti reali richiede tempo e denaro. I simulatori di studenti possono fornire un’indicazione indiretta, ma gli approcci esistenti hanno dei limiti: i modelli che tracciano lo stato dello studente ne riproducono il comportamento, ma faticano a elaborare spiegazioni o correzioni; i giochi di ruolo basati su LLM seguono le indicazioni con scioltezza, ma non rispecchiano in modo affidabile il livello di competenza dello studente imitato. Presentiamo StudentSim, un metodo di addestramento che trasforma i pochi dati disponibili per ciascuno studente in simulatori individualizzati, attraverso un addestramento su dati aggregati seguito da una specializzazione per ciascuno studente. I simulatori così ottenuti riproducono le risposte dello studente e le aggiornano in base alle indicazioni del tutor. Presentiamo inoltre StudentSimEval, un protocollo standardizzato che comprende 60 studenti nei campi degli scacchi, della scrittura in inglese come seconda lingua e della matematica. Il protocollo utilizza dataset pubblici di studenti, con dati privati degli elementi identificativi e condivisi per la ricerca. StudentSimEval misura la fedeltà comportamentale (F), ossia quanto il simulatore riproduce le risposte di uno studente, e la reattività alle indicazioni (R), ossia quanto prontamente si aggiorna in base alle indicazioni del tutor. Tutti i metodi sono addestrati e valutati sugli stessi dati. In tutti e tre gli ambiti, StudentSim supera GPT-5.4 in entrambe le metriche. Negli scacchi, StudentSim raggiunge F=0,51 e R=0,91, contro 0,23 e 0,72 per GPT-5.4 e 0,45 e 0,27 per Maia2. Come prova di fattibilità, l’uso di StudentSim come modello di ricompensa per l’apprendimento per rinforzo di un tutor produce un tutor di scacchi che esperti umani giudicano più accurato, meglio guidato e più personalizzato rispetto a un tutor di riferimento senza apprendimento per rinforzo e a un tutor addestrato con la ricompensa di un simulatore GPT-5.4. Il codice è disponibile all’indirizzo https://github.com/microsoft/StudentSim.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv