Vai al contenuto
AI.info

Ricerca

TeleAntiFraud 2.0: un benchmark aggiornabile, basato sui profili e sull’audio per rilevare le frodi telefoniche

I copioni delle frodi telefoniche evolvono rapidamente e spesso sono concepiti per somigliare a normali conversazioni di servizio. Questo pone due requisiti fondamentali per la valutazione delle frodi

TeleAntiFraud 2.0: un benchmark aggiornabile, basato sui profili e sull’audio per rilevare le frodi telefoniche
arXiv
2609.18748
Pubblicato
2026-09-16
Autori
Huiyuan Liu, Zhiming Ma, Yanxing Liu, Shun Zhang, Qifan Wang, Di Liu, Yifan Wang, Yuyang Deng, Haoyang Meng, Yijin Zhou, Yuxi Zhao, Chengxian Hu, Peidong Wang, Peng Chen

Abstract degli autori

I copioni delle frodi telefoniche evolvono rapidamente e spesso sono concepiti per somigliare a normali conversazioni di servizio. Questo pone due requisiti fondamentali per la valutazione delle frodi telefoniche basata sull’audio. In primo luogo, i benchmark devono incorporare gli schemi di truffa osservati di recente senza sovrascrivere i set di test già definiti. In secondo luogo, devono distinguere le frodi dalle chiamate lecite di ambito affine, anziché affidarsi a esempi negativi relativi a temi distinti. Presentiamo TeleAntiFraud 2.0, costruito con la nostra pipeline Mixed-Tree Anti-Fraud Generation Pipeline e valutato secondo un protocollo mensile con set di valutazione fissati. La pipeline trasforma sintesi di casi di frode pubblicati online in scenari basati su profili, li amplia mediante una generazione ad alberi misti, produce percorsi di dialogo fraudolenti e non fraudolenti in contesti condivisi, rende i dialoghi convalidati come parlato coerente con i ruoli e fissa, per ciascun set di valutazione mensile, gli audio, le etichette, i prompt, i manifest e i dati sulla provenienza. Ogni set fissato contiene 900 chiamate in cinese: 600 casi di frode e 300 casi non fraudolenti di ambito affine. Esperimenti controllati sul testo mostrano che tre classificatori raggiungono un punteggio F1 con media macro (Macro-F1) perfetto quando sono valutati su esempi negativi non correlati o ordinari, ma scendono a 0,65-0,68 con esempi negativi di ambito affine generati come controparti negli stessi contesti. Le valutazioni sull’intero set basate sull’audio e sul riconoscimento automatico del parlato abbinato a un modello linguistico di grandi dimensioni (ASR+LLM) rivelano inoltre scorciatoie basate sulle probabilità a priori delle classi, il collasso delle predizioni e la sensibilità allo snapshot. Nel complesso, questi risultati indicano che la costruzione di casi di ambito affine e una rendicontazione che tenga conto del collasso sono requisiti fondamentali per valutare i modelli di rilevamento delle frodi telefoniche basati sull’audio in condizioni realistiche in cui i casi sono difficili da distinguere. Il materiale di ricerca che accompagna il lavoro comprende il codice di costruzione, gli script di valutazione, i manifest e la documentazione. Il nostro dataset e il nostro codice sono disponibili all’indirizzo https://anonymous.4open.science/r/TeleAntiFraud-2_0-EEB2/.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv