Vai al contenuto
AI.info

Ricerca

EVISKILL: ancorare l’evoluzione delle competenze a evidenze verificabili tramite replay

L’evoluzione continua delle competenze consente agli agenti basati su LLM di accumulare e perfezionare conoscenze procedurali riutilizzabili grazie all’esperienza maturata nelle interazioni, senza agg

EVISKILL: ancorare l’evoluzione delle competenze a evidenze verificabili tramite replay
arXiv
2610.05030
Pubblicato
2026-10-04
Autori
Yan Zhou, Yili Wang, Yiwei Dai, Qinggang Zhang, Xin Wang

Abstract degli autori

L’evoluzione continua delle competenze consente agli agenti basati su LLM di accumulare e perfezionare conoscenze procedurali riutilizzabili grazie all’esperienza maturata nelle interazioni, senza aggiornare i parametri del modello. La sua efficacia dipende dalla capacità di stabilire non solo che cosa modificare, ma anche perché una modifica sia giustificata e quando debba diventare un’indicazione permanente. Tuttavia, i metodi esistenti basati sull’esperienza possono perdere le evidenze relative al comportamento e i contesti delle attività su cui si fondano le modifiche. Inoltre, l’esito di una validazione globale offre una valutazione incompleta delle singole modifiche: correzioni suffragate da evidenze locali possono essere scartate insieme a una revisione respinta, mentre le evidenze possono richiedere ulteriore esperienza prima di contribuire ad aggiornamenti utili. Per affrontare questo problema, presentiamo EVISKILL, un framework basato sulle evidenze che organizza le osservazioni raccolte durante l’esecuzione in Replayable Evidence Cards e formula modifiche collegandole esplicitamente ai contesti che le giustificano. Un replay mirato verifica queste modifiche mediante una nuova esecuzione e fornisce riscontri per correggerle. Nel corso delle epoche, EVISKILL conserva le evidenze e mantiene in via provvisoria le modifiche suffragate, per perfezionarle ulteriormente, mentre la validazione globale ne determina l’integrazione nella competenza finale. Esperimenti condotti su tre benchmark interattivi con sei LLM di base dimostrano l’efficacia di questo approccio.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv