Ricerca
MOLE: rilevare le minacce interne negli agenti di IA
Il disallineamento dei modelli, la prompt injection o l’uso improprio da parte degli operatori potrebbero indurre gli agenti di IA che operano su account di laboratori di frontiera a sottrarre i pesi

- arXiv
- 2609.06966
- Pubblicato
- 2026-09-07
- Autori
- Aashiq Muhamed, Virginia Smith
Abstract degli autori
Il disallineamento dei modelli, la prompt injection o l’uso improprio da parte degli operatori potrebbero indurre gli agenti di IA che operano su account di laboratori di frontiera a sottrarre i pesi dei modelli, contaminare i dati di addestramento o indebolire i controlli per il rilascio. I benchmark esistenti non verificano se, con risorse limitate per la revisione, i sistemi di difesa siano in grado di rilevare queste attività tra quelle di routine. Presentiamo MOLE, un benchmark aperto con 150 account gestiti da IA che condividono 9 servizi con stato nell’arco di 30 giorni lavorativi, 12 minacce e 8 corpora prodotti da quattro modelli, per un totale di circa 20 miliardi di token. Tra 39 modelli di agenti, il 72% porta a termine la maggior parte degli obiettivi dannosi assegnati, e il rifiuto degli agenti non permette di prevedere se li porteranno a termine. MOLE consente di confrontare 40 sistemi di monitoraggio tra diversi generatori di corpora, livelli di osservabilità e minacce; persino il migliore tra quelli valutati nel nostro confronto degli eventi di audit di una sola giornata non rileva quasi la metà delle azioni dannose portate a termine. MOLE consente anche di sviluppare sistemi di monitoraggio: la ricerca guidata dal benchmark migliora un sistema di fascia intermedia del 49-64%, mentre l’impiego selettivo di un sistema più efficace migliora la budget-AUC del 10% rispetto al suo impiego per ogni account-giorno, a un costo modellizzato comparabile.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv