Ricerca
StepGuard: apprendere guardrail a livello di singolo passaggio con supervisione scalabile e bilanciamento tra sicurezza e utilità
Gli agenti basati su LLM possono interagire con ambienti esterni invocando strumenti, ma questa capacità comporta anche rischi per la sicurezza, come la modifica di file, la divulgazione di informazio

- arXiv
- 2608.24777
- Pubblicato
- 2026-08-25
- Autori
- Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu
Abstract degli autori
Gli agenti basati su LLM possono interagire con ambienti esterni invocando strumenti, ma questa capacità comporta anche rischi per la sicurezza, come la modifica di file, la divulgazione di informazioni e l’esecuzione di azioni non autorizzate. I guardrail esistenti spesso valutano traiettorie già completate, mentre il monitoraggio delle singole azioni prima della loro esecuzione è stato poco studiato. Proponiamo StepGuard, un modello di protezione a livello di singolo passaggio capace di verificare le traiettorie completate dagli agenti e controllare le azioni degli strumenti prima che vengano eseguite. Per addestrare StepGuard, introduciamo StepGen, un sistema automatico di generazione dei dati che produce traiettorie sicure e non sicure con lo stesso contesto, ma con azioni diverse nel passaggio rischioso. Per ridurre ulteriormente sia l’eccesso sia la carenza di protezione, proponiamo Balance-GRPO, che bilancia dinamicamente l’apprendimento relativo alle azioni sicure e non sicure in base alla rispettiva accuratezza osservata. Gli esperimenti mostrano che StepGuard raggiunge la massima accuratezza media tra i modelli di protezione a pesi aperti, con prestazioni paragonabili a quelle di GPT-5.4. Quando viene usato per proteggere gli agenti su AgentDojo e AgentDyn, StepGuard riduce il tasso medio di successo degli attacchi del 77,3% rispetto alla configurazione senza protezioni, mentre l’utilità media diminuisce di soli 2,8 punti percentuali.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv