Vai al contenuto
AI.info

The Pulse

Microsoft collega l’individuazione dei rischi degli agenti ai test delle policy in fase di esecuzione

Microsoft ha presentato run-assert-eval, una skill per VS Code che collega l’individuazione dei rischi degli agenti di IA, la valutazione e i test delle policy in fase di esecuzione. In un esempio di assistenza per la fatturazione, l’aziend

Microsoft collega l’individuazione dei rischi degli agenti ai test delle policy in fase di esecuzione

AI.info Team ·

Il nuovo flusso di lavoro di Microsoft parte dai rischi che i team non avevano individuato

I team che sviluppano agenti di IA devono fare i conti con uno scarto tra i rischi che possono testare e quelli che hanno pensato di mettere per iscritto. Microsoft afferma che la nuova skill run-assert-eval è progettata per colmare questo divario individuando prima i rischi, misurando gli errori degli agenti, generando policy in fase di esecuzione e ripetendo la valutazione. L’azienda ha annunciato lo strumento il 24 settembre 2026, descrivendolo come un modo per collegare tre progetti open source in un unico flusso di lavoro.

La sequenza inizia con Clarity, che modella le minacce a cui è esposto un agente per individuare possibili modalità di errore. ASSERT trasforma quei rischi in scenari di valutazione e misura il comportamento dell’agente; Agent Control Specification, o ACS, fornisce i controlli in fase di esecuzione. La skill collega le varie fasi tramite un unico prompt in Visual Studio Code, sostituendo i passaggi manuali che, secondo Microsoft, possono far perdere il contesto o rendere meno efficaci i confronti tra le diverse esecuzioni dei test.

Un agente per la fatturazione ha esposto i dati di un altro cliente

Microsoft illustra il flusso di lavoro con un agente di assistenza per la fatturazione e un test di esposizione ai dati di altri clienti. Nella valutazione iniziale, l’agente ha restituito i dati di un altro cliente in 12 delle 40 conversazioni pertinenti, con un tasso di violazione osservato del 30%. L’azienda afferma che l’account chiamante dell’agente era impostato su ACME-1001, quindi le richieste dei dati di un altro cliente non avrebbero dovuto andare a buon fine.

Dopo che il team ha aggiunto una policy ACS, nell’esecuzione controllata sono state registrate due violazioni su 34 conversazioni pertinenti, pari al 5,9%, e nessuna violazione dei comportamenti consentiti in quel campione. I denominatori differiscono perché i conteggi si riferiscono alle conversazioni pertinenti in ciascuna esecuzione. Si tratta dei risultati dell’esempio pratico di Microsoft, non di una misura dei tassi di errore degli agenti già distribuiti.

La policy blocca le chiamate agli strumenti in fase di esecuzione

Nell’esempio, la policy generata nega una chiamata a uno strumento quando l’ID dell’account non corrisponde a quello del chiamante. ACS applica la regola prima della chiamata allo strumento, nel punto di intercettazione pre_tool_call, e di nuovo dopo la chiamata, per impedire che un risultato improprio entri nel contesto del modello. Microsoft afferma che la decisione è deterministica, quindi il controllo non chiede a un altro modello di stabilire se una richiesta sembri sospetta.

La generazione della policy non equivale a un’approvazione. Microsoft afferma che, prima della valutazione controllata, i team devono esaminare la policy, il manifest, il punto di intervento e i collegamenti in fase di esecuzione. Il flusso di lavoro ripete quindi la valutazione per verificare la modifica rispetto ai risultati iniziali; mantenere invariato il set di test dovrebbe rendere il confronto più significativo rispetto ai risultati ottenuti da esecuzioni non correlate.

La skill include sette esempi pratici in diversi ambiti

Microsoft afferma che la skill è distribuita nel repository ASSERT insieme a sette esempi pratici in diversi ambiti e 14 suite di rischi. Gli esempi includono l’assistenza per la fatturazione, la risposta a domande sui documenti di Azure, il controllo delle modifiche, la ricerca scientifica, due agenti per la pianificazione di viaggi e agenti clinici basati su prompt, testati con e senza strumenti. Secondo l’annuncio, ASSERT e ACS sono disponibili con licenza MIT.

La versione si basa sugli strumenti introdotti in precedenza da Microsoft nel 2026, ma aggiunge l’individuazione dei rischi prima della valutazione e della generazione delle policy. Il punto di partenza passa così dai requisiti già messi per iscritto da un team a un modello delle minacce che può individuare errori non contemplati da quei requisiti. L’esempio sulla fatturazione si conclude con un cambiamento misurabile: dopo l’aggiunta della policy in fase di esecuzione, si sono verificate due violazioni relative ai dati di altri clienti in 34 conversazioni pertinenti.

Fonte

Esplora

Altri articoli