The Pulse
MobileCybench individua 23 vulnerabilità Android mai segnalate prima
Un benchmark basato su sonde di sicurezza eseguibili verifica come gli agenti di programmazione individuano le vulnerabilità nelle applicazioni Android.

AI.info Team ·
La realizzazione e l’esecuzione di MobileCybench hanno portato alla luce 23 vulnerabilità mai segnalate prima nelle applicazioni Android, secondo l’abstract del benchmark. Il progetto valuta se gli agenti di programmazione basati sull’IA siano in grado di creare exploit che violano proprietà di sicurezza specifiche delle applicazioni.
MobileCybench usa sonde eseguibili, anziché basarsi soltanto su un catalogo di vulnerabilità note. Ogni sonda rappresenta una proprietà di sicurezza che un’applicazione dovrebbe preservare. I ricercatori valutano un exploit inviato riproducendolo sull’applicazione ed eseguendo le sonde pertinenti. L’attivazione di una sonda indica che l’exploit è riuscito e identifica la proprietà di sicurezza che ha violato.
Poiché le sonde codificano proprietà anziché bug specifici già documentati, il framework può individuare vulnerabilità che non erano note quando le sonde sono state scritte. Il benchmark mette così in relazione la generazione di exploit con una verifica riproducibile dello stato risultante dell’applicazione.
Cinque agenti di programmazione, quattro scenari di attacco
Il benchmark copre 13 applicazioni Android e comprende 495 sonde scritte e revisionate dagli autori. Valuta cinque agenti di programmazione: OpenCode con GPT-5.5, GPT-5.6-Sol e GLM-5.2, e Claude Code con Opus 4.8 e Opus 5.
Ogni agente viene testato in quattro scenari. La prima distinzione riguarda la posizione dell’attaccante: l’agente opera come app malevola sul dispositivo della vittima oppure come attaccante remoto con un account dai privilegi limitati. La seconda distinzione riguarda le informazioni a disposizione dell’agente: riceve soltanto un APK offuscato oppure può accedere al codice sorgente dell’applicazione.
I risultati indicano che la posizione dell’attaccante influisce notevolmente sulle prestazioni. Disponendo soltanto dell’APK offuscato, OpenCode con GPT-5.6-Sol ha attivato sonde nel 53,8% delle applicazioni nello scenario dell’app malevola. Nello scenario dell’attaccante remoto, lo stesso agente ha attivato sonde nel 16,7% delle applicazioni.
Il codice sorgente ha prodotto un aumento più contenuto
Considerando tutti gli agenti e i due scenari di attacco, il tasso di attivazione è salito dal 28,8% con il solo accesso all’APK al 32,8% quando gli agenti avevano accesso al codice sorgente.
Queste percentuali misurano la quota di applicazioni per le quali l’exploit inviato da un agente ha attivato almeno una sonda. Non dimostrano che gli agenti abbiano trovato tutte le vulnerabilità di un’applicazione, né che un’applicazione in cui non si è attivata alcuna sonda sia sicura. Il benchmark registra invece se l’exploit inviato ha violato una delle proprietà di sicurezza definite.
La realizzazione e la valutazione del benchmark hanno inoltre portato alla scoperta delle 23 vulnerabilità mai segnalate prima. La fonte afferma che la maggior parte di queste scoperte è stata confermata dai responsabili della manutenzione. Nella pagina con la fonte dell’articolo, non fornisce una suddivisione delle scoperte per stato di convalida, stato delle patch o identificativo CVE pubblico.
I risultati di MobileCybench presentano una verifica circoscritta della scoperta automatizzata di vulnerabilità: in quattro condizioni controllate, gli agenti di programmazione hanno generato exploit che hanno attivato controlli eseguibili nelle applicazioni Android. I risultati mostrano inoltre che le prestazioni variano sia in base al modello di attaccante sia alle informazioni fornite all’agente.