The Pulse
ActGov inserisce controlli delle policy prima che gli agenti IA eseguano chiamate agli strumenti
Un articolo su arXiv presenta ActGov, un framework per l’applicazione delle policy in fase di esecuzione, che convalida le azioni proposte tramite strumenti rispetto a policy di autorizzazione e sicurezza circoscritte al compito, prima che

AI.info Team ·
Gli agenti IA svolgono sempre più spesso flussi di lavoro di lunga durata tramite strumenti esterni, consentendo alle informazioni provenienti da output non attendibili di influenzare le azioni successive. Un articolo inviato ad arXiv il 21 settembre 2026 presenta ActGov, un framework per l’applicazione delle policy in fase di esecuzione, progettato per convalidare l’azione proposta da un agente tramite uno strumento prima che produca un effetto esterno.
L’articolo presenta il sistema come un’alternativa alle difese che isolano i contenuti iniettati o vincolano gli agenti a piani predefiniti e policy statiche. Secondo l’abstract, questi approcci possono risultare fragili quando i flussi di lavoro cambiano e difficili da estendere a ecosistemi di strumenti in espansione. ActGov, invece, valuta ogni azione proposta nel momento in cui viene formulata, mantenendo il controllo dell’autorizzazione durante tutto il flusso di lavoro, che può diramarsi in risposta a nuove osservazioni.
ActGov separa le proposte di azione dall’autorizzazione
Il framework comprende due componenti con nome proprio. ActGov-Policy costruisce un insieme di policy a partire dalle specifiche degli strumenti, da attività innocue e da tracce di errori osservati. L’insieme di policy viene aggiornato iterativamente e ogni modifica viene sottoposta a una verifica dei controesempi basata su SMT. L’abstract descrive questo processo come un modo per verificare se una policy proposta contiene un controesempio ai suoi requisiti di sicurezza, prima di accettare l’aggiornamento.
ActGov-Runtime gestisce l’applicazione delle policy durante l’esecuzione. Rappresenta ogni chiamata a uno strumento tramite un insieme finito di record di policy e la consente solo se resta entro il perimetro di autorizzazione assegnato al compito e soddisfa tutte le policy applicabili. La decisione viene presa prima che l’azione proposta produca un effetto esterno.
Questa struttura lascia al modello linguistico il compito di proporre azioni, ma non quello di prendere la decisione finale sull’autorizzazione. L’obiettivo dichiarato dell’articolo è applicare un’autorizzazione granulare senza fare affidamento sulla capacità del modello sottostante di riconoscere correttamente le istruzioni malevole. Un’azione può quindi essere valutata rispetto alla policy in vigore anche quando materiale non attendibile ha influenzato la proposta del modello.
I controlli su ogni azione supportano flussi di lavoro con diramazioni
L’abstract sottolinea che ActGov è pensato per flussi di lavoro di lunga durata in cui l’azione successiva non è definita in anticipo. Invece di imporre all’agente una sequenza prestabilita, il framework verifica ogni nuova chiamata a uno strumento rispetto al perimetro di autorizzazione del compito e ai vincoli di sicurezza applicabili in quel momento dell’esecuzione.
Questa distinzione è importante per gli agenti che utilizzano ripetutamente strumenti esterni. Un sistema può iniziare con un obiettivo, ricevere ulteriori informazioni da uno strumento e poi proporre un’azione diversa. La componente runtime di ActGov, secondo la descrizione, valuta la nuova chiamata come un record di policy a sé stante, mantenendo al contempo le condizioni di autorizzazione stabilite per il compito.
L’articolo non presenta il framework come una garanzia che ogni possibile attacco fallirà. L’abstract riferisce invece di una valutazione sui benchmark AgentDojo e AgentDyn, condotta con diversi modelli e configurazioni di attacco. Gli autori affermano che ActGov riduce costantemente il tasso di successo degli attacchi di prompt injection indiretta, preservando al contempo l’utilità per il compito e superando nettamente le difese esistenti.
La valutazione comprende AgentDojo e AgentDyn
L’abstract indica AgentDojo e AgentDyn come contesti di valutazione, ma non fornisce il numero di test dei benchmark, i nomi dei modelli, le percentuali di successo degli attacchi né i punteggi di utilità. Non specifica neppure le diverse configurazioni di attacco né riporta risultati sul trasferimento tra domini.
I risultati riportati sono presentati in termini generali: ActGov riduce il tasso di successo degli attacchi di prompt injection indiretta mantenendo l’utilità per il compito. L’articolo afferma che questi risultati dimostrano che il framework può applicare un’autorizzazione granulare alle esecuzioni dinamiche degli agenti senza dipendere dalla capacità del modello linguistico di identificare correttamente le istruzioni malevole.
La fonte disponibile non specifica neppure le categorie dettagliate delle policy, gli ambiti semantici, i livelli di formazione, il flusso di lavoro del solver o le condizioni del modello di minaccia descritti in alcune ricostruzioni del sistema. Per conoscere questi dettagli di implementazione e i risultati numerici servirebbero riscontri nell’articolo completo, non nel solo abstract di arXiv.
La costruzione delle policy resta parte del progetto
L’approccio di ActGov attribuisce importanza al modo in cui vengono definite le policy prima che inizi l’applicazione in fase di esecuzione. La componente ActGov-Policy utilizza come input le specifiche degli strumenti, le attività innocue e le tracce degli errori osservati, quindi costruisce e verifica iterativamente l’insieme di policy. L’applicazione in fase di esecuzione usa le policy risultanti sulle singole chiamate, invece di chiedere al modello di formulare un giudizio di sicurezza senza vincoli basandosi sul testo circostante.
La tesi centrale dell’articolo è quindi più circoscritta della promessa di rendere gli agenti sicuri in generale. ActGov viene presentato come un meccanismo che verifica le azioni proposte tramite strumenti rispetto a vincoli di autorizzazione e sicurezza circoscritti al compito, prima che si producano effetti esterni. La valutazione suggerisce che questo approccio può ridurre il successo degli attacchi di prompt injection indiretta preservando al contempo lo svolgimento di attività utili nei benchmark esaminati dagli autori.
ActGov: governare le azioni degli agenti LLM tramite convalida vincolata da policy è a firma di Kaiyuan Zhang, Yuke Peng, Ke Jiang e Yinqian Zhang.