Vai al contenuto
AI.info

Ricerca

AdaGuard: un modello di guardia adattivo con politiche definite dagli utenti

I modelli di guardia contribuiscono a un impiego sicuro degli agenti basati su modelli linguistici, ma le tassonomie fisse dei rischi ne limitano la capacità di adattarsi a requisiti che variano secon

AdaGuard: un modello di guardia adattivo con politiche definite dagli utenti
arXiv
2609.34241
Pubblicato
2026-09-28
Autori
Yunhao Feng, Yifan Ding, Yuxiang Xie, Zheng Li, Mingrui Lao, Zeyuan Wang, Yanming Guo

Abstract degli autori

I modelli di guardia contribuiscono a un impiego sicuro degli agenti basati su modelli linguistici, ma le tassonomie fisse dei rischi ne limitano la capacità di adattarsi a requisiti che variano secondo le applicazioni e i compiti. Con politiche definite dagli utenti, rilevare le violazioni richiede di interpretare sia le regole applicabili sia il comportamento dell’agente, poiché azioni identiche possono essere giudicate diversamente in base alla politica adottata. Per favorire l’apprendimento di questa capacità, presentiamo AdaptiveSafety, un dataset con 10.939 esempi di addestramento e 1.000 esempi di test, che comprende politiche con un numero di regole compreso tra 1 e 100. Il dataset combina traiettorie provenienti da più fonti con controfattuali relativi alle politiche e ai comportamenti, associando a ogni esempio una spiegazione e l’insieme completo delle regole violate. Questi controfattuali mettono in evidenza i cambiamenti che modificano la conformità alle regole, mentre le modifiche strutturali forniscono segnali per l’addestramento alla coerenza quando le regole vengono riordinate o gli identificatori rimappati. Sulla base di questi segnali, proponiamo SafePO, un algoritmo di apprendimento per rinforzo che affina l’identificazione delle violazioni bilanciando il ragionamento esplicativo e i verdetti finali. SafePO usa ricompense strutturate per valutare la correttezza delle previsioni, mantiene i vantaggi relativi al gruppo a livello di risposta e impiega un modello di valore addestrato separatamente per modulare i pesi dei token nelle sezioni dedicate alla spiegazione e al verdetto. Una normalizzazione separata controlla il contributo relativo di queste sezioni all’addestramento, nonostante le differenze di lunghezza. Attraverso un’inizializzazione supervisionata seguita da SafePO, sviluppiamo AdaGuard, una famiglia di modelli di guardia da 0,6B, 4B e 8B che valutano le traiettorie degli agenti in base alle politiche fornite al momento dell’inferenza. Il nostro modello 4B raggiunge accuratezze binarie dell’89,30\% su AdaptiveSafety e del 71,82\% su DynaBench. Il repository del progetto è disponibile all’indirizzo https://github.com/Yunhao-Feng/AdaGuard

Leggi il paper originale su arXiv