Vai al contenuto
AI.info

Ricerca

MIMESIS: apprendere simulatori di utenti come ambienti di addestramento per agenti interattivi

L’addestramento e la valutazione degli agenti linguistici interattivi richiedono in genere interazioni articolate con gli utenti, ma raccogliere riscontri da persone è costoso e difficile da fare su l

arXiv
2610.09484
Pubblicato
2026-10-07
Autori
Hoang Phan, Dat Huynh, Andrey Zhmoginov, Qi Zeng, Wancen Mu, Yue Cao, Shengjie Bi, Yun He, Changdae Oh, Deren Lei

Abstract degli autori

L’addestramento e la valutazione degli agenti linguistici interattivi richiedono in genere interazioni articolate con gli utenti, ma raccogliere riscontri da persone è costoso e difficile da fare su larga scala. Gli utenti simulati offrono un’alternativa scalabile, ma devono sia somigliare agli utenti reali nel comportamento sia offrire agli agenti esperienze di apprendimento utili. La maggior parte dei framework per l’addestramento degli agenti, invece, si affida a LLM assistenti già disponibili, la cui propensione a essere d’aiuto può renderli eccessivamente collaborativi, espliciti e omogenei nei comportamenti rispetto agli utenti reali. Presentiamo MIMESIS, un simulatore di utenti progettato appositamente, addestrato su conversazioni umane con una supervisione esplicita del ragionamento e 13 schemi comportamentali realistici ricavati da interazioni con utenti reali. Nei test, il nostro modello 9B ottiene un SOUL-Index di 65,7, superando il più potente modello di frontiera. Rispetto a Claude-Opus-5, il modello di riferimento più forte su RealUserSim e SimulatorArena, MIMESIS migliora la fedeltà comportamentale di 13,4 punti e riduce la distanza di Turing di 3,6 punti, rispettivamente. Congeliamo quindi il simulatore e addestriamo un agente attraverso interazioni con esso, usando l’apprendimento per rinforzo su più turni. In otto ambienti, l’addestramento con MIMESIS produce prestazioni dell’agente migliori rispetto all’addestramento con GPT-5.5 con tutti e nove i simulatori di utenti mai visti, dimostrando una maggiore capacità di generalizzare a nuovi simulatori di utenti. Proponiamo inoltre Coached On-Policy Self-Distillation (CSD), che usa le tracce di ragionamento private e gli interventi successivi generati dal simulatore come riscontro su quanto bene l’agente risponda alle esigenze dell’utente. Un tutor trasforma queste informazioni in indicazioni concise su come l’agente possa anticipare meglio le esigenze dell’utente e adattare il proprio comportamento nel corso dell’interazione. CSD trasforma questo riscontro in una supervisione densa a livello di token, che va oltre le ricompense sparse legate al compito e produce ulteriori miglioramenti su tutti e nove i modelli di utenti usati per la valutazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv