Vai al contenuto
AI.info

Ricerca

La misura di protezione ha funzionato. Il sistema basato su LLM è più sicuro?

Le misure di protezione dei servizi basati su LLM in produzione vengono valutate in base ai tassi di rifiuto, di riuscita degli attacchi e di violazione delle policy. Questi tassi descrivono come una

La misura di protezione ha funzionato. Il sistema basato su LLM è più sicuro?
arXiv
2609.00519
Pubblicato
2026-09-01
Autori
Pingyu Wu, Weiming Zhang, Nenghai Yu

Abstract degli autori

Le misure di protezione dei servizi basati su LLM in produzione vengono valutate in base ai tassi di rifiuto, di riuscita degli attacchi e di violazione delle policy. Questi tassi descrivono come una misura ha funzionato sulle richieste con cui è stata messa alla prova. Per un sistema in produzione, però, occorre rispondere a una domanda diversa: quanto il servizio continua ad aiutare un attaccante a svolgere compiti dannosi, se questi continua ad adattarsi o trova un’altra via d’accesso? Stabiliamo che cosa implichi ciascun risultato riportato rispetto a questa domanda, così da confrontare risultati relativi a diversi tipi di misure di protezione secondo un unico criterio per i sistemi in produzione. I requisiti probatori sono fortemente asimmetrici. Basta un solo attacco che ottenga dal servizio in produzione un aiuto per compiti dannosi per dimostrare che tale aiuto resta disponibile, e attacchi del genere ricorrono nei dati codificati. Per dimostrare che ne rimane poco, invece, non bastano i dati della misura di protezione: servono anche evidenze su ciò che il sistema circostante continua a consentire dopo che la misura ha svolto la propria funzione locale. Tali evidenze sono corroborate o ricavate soltanto in una piccola minoranza delle affermazioni sottoposte a codifica approfondita, e una di queste delimita l’aiuto residuo nel proprio ambito specifico. Un punteggio locale migliore, quindi, non costituisce di per sé un’affermazione più solida sul sistema in produzione. La ricerca sulle misure di protezione non può limitarsi a migliorare i punteggi locali: un progresso va valutato in base al fatto che renda o meno più sicuro un sistema in produzione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv