Vai al contenuto
AI.info

Ricerca

Blindspot: un benchmark per la calibrazione della sicurezza e dei rifiuti negli agenti che usano strumenti su orizzonti lunghi

Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) operano sempre più spesso in interazioni prolungate che prevedono l’uso di strumenti, uno stato persistente, autorizzazioni che evol

Blindspot: un benchmark per la calibrazione della sicurezza e dei rifiuti negli agenti che usano strumenti su orizzonti lunghi
arXiv
2609.16305
Pubblicato
2026-09-16
Autori
Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Tejaswini Pedapati, Prasanna Sattigeri

Abstract degli autori

Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) operano sempre più spesso in interazioni prolungate che prevedono l’uso di strumenti, uno stato persistente, autorizzazioni che evolvono e feedback provenienti dall’ambiente esterno. In questi contesti, le violazioni della sicurezza possono emergere solo dopo più turni, eppure le valutazioni esistenti spesso riducono il comportamento degli agenti al successo del compito o dell’attacco, senza chiarire se un agente agisce, rifiuta o mantiene una calibrazione adeguata man mano che l’interazione evolve. Presentiamo Blindspot, un benchmark per la calibrazione della sicurezza a livello di traiettoria negli agenti che usano strumenti su orizzonti lunghi. Blindspot valuta traiettorie complete utente-agente-ambiente attraverso interazioni avversarie adattive, l’esecuzione di strumenti con stato e valutazioni basate sull’esecuzione. La versione attuale comprende 22 famiglie di attacchi e 35 scenari distribuiti in sette domini, per un totale di oltre 2.500 traiettorie prolungate, con una lunghezza media di 14,7 turni. A ogni traiettoria viene assegnato uno di cinque esiti: Completamento sicuro, Rifiuto corretto, Completamento non sicuro, Rifiuto eccessivo o Indeterminato. A differenza dei dataset di attacchi statici, Blindspot è un framework di simulazione dal vivo, estensibile, in cui è possibile aggiungere attacchi, scenari, strumenti, policy, domini e configurazioni degli agenti senza riprogettare la pipeline di valutazione. Valutiamo 13 LLM proprietari e a pesi aperti usando otto metriche che misurano il completamento non sicuro, il rifiuto appropriato, l’utilità in attività innocue, il rifiuto eccessivo, la robustezza su esecuzioni ripetute e il fallimento dopo un rifiuto. I risultati preliminari rivelano differenze sostanziali tra i modelli nella calibrazione tra sicurezza e utilità e mostrano che i fallimenti possono emergere solo dopo diversi passaggi iniziali dell’interazione che si svolgono senza problemi. Questi risultati suggeriscono di considerare la sicurezza degli agenti una proprietà a livello di traiettoria, anziché un criterio di successo binario o riferito a un singolo turno.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv