Ricerca
Quando sono utili i meccanismi interni dei modelli? Il ruolo dell’ingegneria delle rappresentazioni nella sicurezza degli LLM
Per essere affidabili, le misure di sicurezza dell’IA richiedono sia meccanismi di controllo che riducano i comportamenti non sicuri, sia meccanismi di monitoraggio che rilevino i rischi per la sicure

- arXiv
- 2609.34771
- Pubblicato
- 2026-09-28
- Autori
- Tianyi Guan, Jianhui Chen, Liangming Pan
Abstract degli autori
Per essere affidabili, le misure di sicurezza dell’IA richiedono sia meccanismi di controllo che riducano i comportamenti non sicuri, sia meccanismi di monitoraggio che rilevino i rischi per la sicurezza durante le interazioni con il modello. Tra le misure di sicurezza comportamentali consolidate figurano i metodi di allineamento che ottimizzano le risposte del modello e i sistemi di monitoraggio testuale che valutano il testo delle interazioni. L’ingegneria delle rappresentazioni, invece, legge o modifica gli stati interni del modello, ma i punti di forza relativi di questi approcci restano poco chiari perché spesso vengono valutati in condizioni diverse. Presentiamo una valutazione a parità di condizioni su due fronti. Per il controllo della sicurezza, confrontiamo DPO, un metodo di allineamento comportamentale, con tre metodi di steering delle rappresentazioni in termini di robustezza, praticità e granularità. DPO offre nel complesso il controllo più efficace e in generale migliora all’aumentare dei dati di addestramento, anche se la sicurezza può peggiorare dopo un successivo fine-tuning su dati benigni. Lo steering delle rappresentazioni resta competitivo soprattutto quando i dati sono scarsi, in particolare se si dispone di dati contrastivi di alta qualità. Per il monitoraggio della sicurezza, confrontiamo sonde delle rappresentazioni con sistemi di monitoraggio testuale sottoposti a fine-tuning e a pesi aperti, valutando il rilevamento sulla risposta completa, il rilevamento precoce e il costo computazionale. I sistemi di monitoraggio testuale specializzati raggiungono nel complesso la massima accuratezza di rilevamento, mentre le sonde delle rappresentazioni restano competitive a un costo marginale notevolmente inferiore. Infine, gli interventi guidati dai sistemi di monitoraggio recuperano gran parte della sicurezza persa da DPO dopo il fine-tuning su dati benigni, con un aumento minimo dei rifiuti eccessivi. Nel complesso, l’ingegneria delle rappresentazioni non sostituisce in generale le misure di sicurezza comportamentali, ma offre vantaggi pratici in condizioni specifiche e può apportare benefici complementari per la sicurezza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv