Ricerca
LMSM: un framework di sicurezza per LLM ispirato ai Linux Security Modules
I modelli linguistici di grandi dimensioni (LLM) vengono impiegati sempre più spesso con difese a più livelli, ma i prompt malevoli possono comunque aggirarle. I metodi di interpretabilità possono riv

- arXiv
- 2608.25697
- Pubblicato
- 2026-08-26
- Autori
- XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) vengono impiegati sempre più spesso con difese a più livelli, ma i prompt malevoli possono comunque aggirarle. I metodi di interpretabilità possono rivelare segnali interni al modello lungo il processo di generazione, utili a orientare l’applicazione delle misure di sicurezza; da soli, però, questi segnali non costituiscono controlli di sicurezza. Le implementazioni che li adattano a questo scopo associano generalmente a ciascun segnale una propria calibrazione, una logica per le policy e un codice di intervento: ogni nuovo artefatto comporta quindi lavoro di integrazione, anziché rafforzare una difesa condivisa. Presentiamo Language Model Security Modules (LMSM), un framework di sicurezza che adatta al serving degli LLM la separazione alla base dei Linux Security Modules (LSM). In LMSM, un backend di sicurezza selezionato fornisce evidenze calibrate, una policy versionata valuta le regole attive sulla base di un contesto affidabile specifico di ogni richiesta e un meccanismo di controllo separato autorizza il rilascio dell’output mantenuto in buffer. Questa architettura distingue la correttezza del controllo dall’efficacia della policy e consente di modificare il backend, le regole o la pianificazione senza ricostruire la gestione delle richieste o i meccanismi di applicazione delle regole. Il nostro prototipo mostra che questa separazione funziona nella pratica: con Hugging Face Transformers e vLLM con batching continuo, la stessa infrastruttura ospita implementazioni di autoencoder sparsi (SAE) e transcoder basate su artefatti, oltre a probe dense adattate al compito; mantiene le decisioni specifiche per ogni richiesta anche quando cambia la pianificazione dello scheduler; e applica selettivamente e combina più regole per richiesta. Su Qwen3-4B, LMSM-Checkpoint riduce il tasso di successo degli attacchi su HarmBench dal 39,20% al 3,32%, mentre i rifiuti ingiustificati su XSTest salgono dal 2,40% al 4,40%. Al tempo stesso, con 32 sequenze attive, mantiene il 98,14% del throughput di un percorso di serving equivalente che non svolge alcuna attività di monitoraggio. LMSM offre ai progressi nell’interpretabilità e nell’analisi interna dei modelli un percorso comune verso l’applicazione delle misure di sicurezza durante l’esecuzione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv