Vai al contenuto
AI.info

Ricerca

RiskChainBench: un benchmark per ricostruire messaggi offuscati sulle piattaforme e indagare sul web sulla base di prove

Le campagne di abuso delle piattaforme nascondono istruzioni di reindirizzamento con emoji, omofoni, scomposizione dei caratteri e simboli ridondanti, per poi indirizzare gli utenti attraverso link ca

RiskChainBench: un benchmark per ricostruire messaggi offuscati sulle piattaforme e indagare sul web sulla base di prove
arXiv
2609.16900
Pubblicato
2026-09-15
Autori
ZhuoXin Liu, Zhiming Ma, Ying Zhang, Mengzheng Yang, Yifan Wang, Zhengqi Huang, Yanhan Zhou, Zekun Lin, Jun Zhang, Shun Zhang, Yue Chen, Qiao Zhao, Peng Chen

Abstract degli autori

Le campagne di abuso delle piattaforme nascondono istruzioni di reindirizzamento con emoji, omofoni, scomposizione dei caratteri e simboli ridondanti, per poi indirizzare gli utenti attraverso link camuffati verso servizi associati alla pornografia, alle frodi, al gioco d’azzardo o a transazioni illecite. I benchmark esistenti valutano separatamente i testi offuscati e le pagine web rischiose, rendendo meno chiaro in che modo il recupero della destinazione influisca sulla successiva raccolta di prove. Presentiamo RiskChainBench, che abbina 3.600 input sintetici per il ripristino di testi composti da token, ricavati da 600 sessioni di origine, a 600 corrispondenti ambienti web locali etichettati da persone. Un modello ricostruisce dapprima il messaggio, l’intento operativo e la destinazione; lo stesso modello sottostante agisce poi come agente web guidato da un modello visivo-linguistico (VLM), esamina il sito web correttamente associato e produce un rapporto sul rischio corredato di riferimenti alle prove, che viene poi reso immutabile, senza indizi sulla semantica del messaggio o sulla reputazione del dominio. Valutiamo separatamente il ripristino e l’indagine sul web con corretto instradamento, quindi li combiniamo offline usando la previsione fissata del punto di ingresso principale come condizione per lo stesso risultato del Task 2. Le etichette assegnate da persone determinano la correttezza del compito, mentre un valutatore multimodale fisso valuta l’aderenza alle prove, la sufficienza, la completezza e la coerenza. Su dieci modelli, Entry Top-1 varia dal 35,2% al 95,2% e l’accuratezza delle decisioni sui siti web dal 26,3% al 62,8%; i sistemi migliori non sono gli stessi nel recupero del punto di ingresso, nella ricostruzione completa, nelle decisioni sui siti web e nella classificazione dettagliata. I problemi di esecuzione rappresentano il 31,9% delle sessioni web, mentre gli errori di classificazione del tipo successivi alla decisione rappresentano solo lo 0,9%: ciò individua nell’esplorazione affidabile e nella valutazione del rischio i principali ostacoli. Rendiamo disponibili il benchmark, il protocollo e la sandbox locale ripristinabile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv