Vai al contenuto
AI.info

Ricerca

SkillDRE: evoluzione red team delle skill degli agenti in due fasi, con feedback prima e durante l’esecuzione

Le skill degli agenti raccolgono istruzioni, codice eseguibile e risorse specifiche per il compito in artefatti riutilizzabili, che gli agenti possono migliorare grazie al feedback ottenuto dall’esecu

SkillDRE: evoluzione red team delle skill degli agenti in due fasi, con feedback prima e durante l’esecuzione
arXiv
2609.32400
Pubblicato
2026-09-26
Autori
Pengyu Zhu, Jingyi Yang, Yi Liu, Li Sun, Sen Su

Abstract degli autori

Le skill degli agenti raccolgono istruzioni, codice eseguibile e risorse specifiche per il compito in artefatti riutilizzabili, che gli agenti possono migliorare grazie al feedback ottenuto dall’esecuzione. Lo stesso meccanismo consente anche agli aggressori di far evolvere skill malevole, rendendole più efficaci e meno rilevabili. Tuttavia, una skill candidata può superare la scansione prima dell’esecuzione senza raggiungere il proprio obiettivo in presenza di difese durante l’esecuzione, mentre una revisione che risolve i problemi di esecuzione può generare nuove segnalazioni dello scanner. Presentiamo SkillDRE, un framework completamente automatizzato che fa evolvere pacchetti completi di skill malevole attraverso un ciclo di feedback in due fasi. A partire da un compito benigno e dalle skill a esso associate, SkillDRE costruisce e convalida autonomamente un obiettivo malevolo condizionato dal compito e una regola di valutazione verificabile. Mantiene poi entrambi invariati mentre fa evolvere l’implementazione della skill, preservandone la capacità di svolgere il compito legittimo. SkillDRE combina un’evoluzione guidata dallo scanner con un perfezionamento guidato dai risultati osservati durante l’esecuzione in presenza di difese. Ogni revisione guidata da questi risultati torna alla fase precedente l’esecuzione per una nuova scansione e un’ulteriore ottimizzazione prima di essere eseguita di nuovo, formando un ciclo chiuso tra le due fasi. Valutato su SkillsBench con quattro modelli vittima, SkillDRE raggiunge un tasso medio di successo degli attacchi del 45,28%, superiore del 40,3% a quello del miglior metodo di riferimento. Le skill presentate nella versione finale, inoltre, non ricevono alcuna segnalazione da SkillScan e preservano in larga misura le prestazioni nei compiti benigni. Questi risultati mostrano che il feedback delle difese nelle due fasi può offrire un utile segnale di apprendimento per il red teaming adattivo e che valutare isolatamente una delle due fasi può non rilevare la capacità di attacco che ne risulta. Il codice è disponibile all’indirizzo https://github.com/whfeLingYu/SkillDRE

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv