Ricerca
FRAUDSkill: ottimizzazione strutturata delle competenze a pesi congelati per il rilevamento delle frodi audio
I grandi modelli audio-linguistici hanno mostrato potenzialità nel rilevamento delle frodi, elaborando direttamente il parlato e ragionando sugli indizi pertinenti. La loro implementazione richiede tu

- arXiv
- 2609.18766
- Pubblicato
- 2026-09-16
- Autori
- Chengxian Hu, Zhiming Ma, Mingjun Pan, Yifan Wang, Shun Zhang, Qifan Wang, Zhilei Zhao, Yijin Zhou, Yuxi Zhao, Huiyuan Liu, Peidong Wang, Peng Chen
Abstract degli autori
I grandi modelli audio-linguistici hanno mostrato potenzialità nel rilevamento delle frodi, elaborando direttamente il parlato e ragionando sugli indizi pertinenti. La loro implementazione richiede tuttavia che le previsioni rispettino uno spazio di etichette predefinito e un protocollo decisionale strutturato, che prevede l’identificazione dello scenario di servizio, il rilevamento delle frodi e la classificazione condizionale del tipo di frode. Gli approcci esistenti basati sul fine-tuning e sui prompt codificano in genere conoscenze del compito, vincoli e regole decisionali nei parametri del modello o in prompt mantenuti manualmente, rendendo difficile adattarli all’evoluzione dei modelli di frode e delle politiche di etichettatura. A questo scopo, proponiamo FRAUDSkill, un framework strutturato di adattamento a pesi congelati che lascia invariato il modello audio-linguistico sottostante, ottimizzando al contempo uno strato esterno di programmi di competenze, politiche specifiche per ciascun percorso e regole decisionali. Inoltre, combiniamo il controllo dell’output strutturato con un’inferenza multipercorso guidata dalla convalida, per garantire previsioni conformi al protocollo. Sul benchmark TeleAntiFraud, FRAUDSkill raggiunge un Macro-F1 del 73,50%, superando di 31,96% la baseline condivisa del modello congelato e riducendo gli output non validi all’1,94%. Esperimenti approfonditi dimostrano che l’ottimizzazione esterna delle competenze offre una soluzione efficace e adattabile per il rilevamento strutturato delle frodi audio, senza modificare il modello sottostante. Il codice sorgente è disponibile all’indirizzo https://anonymous.4open.science/r/FRAUDSKILL-114514.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv