Vai al contenuto
AI.info

Ricerca

Sicurezza per chi? Autodistillazione attenta ai confini per un rifiuto controllato ai fini della sicurezza degli LLM

L’allineamento per la sicurezza viene di solito posto come una questione che riguarda il tema: questo argomento è dannoso? Le applicazioni concrete richiedono una distinzione più precisa. Un tutor di

Sicurezza per chi? Autodistillazione attenta ai confini per un rifiuto controllato ai fini della sicurezza degli LLM
arXiv
2609.04482
Pubblicato
2026-09-03
Autori
Alejo López-Ávila, Iker García-Ferrero, Jezabel Garcia, Antonio Tiene, Román Orús

Abstract degli autori

L’allineamento per la sicurezza viene di solito posto come una questione che riguarda il tema: questo argomento è dannoso? Le applicazioni concrete richiedono una distinzione più precisa. Un tutor di educazione civica e un assistente per il settore pubblico possono condividere lo stesso modello di base, ma aver bisogno di confini diversi all’interno dello stesso tema: devono rifiutare la manipolazione politica mirata, continuando però a rispondere a domande fattuali sulla stessa elezione. Formuliamo questo problema come sicurezza dai confini circoscritti e introduciamo un framework offline basato sulla generazione autonoma, che combina generazione controllata di argomenti, recupero della copertura, dati di compensazione nella distribuzione e coppie di richieste dannose e innocue per l’addestramento e la valutazione. Con la generazione in un solo tentativo, il 19,88% dei prompt resta senza tracce di rifiuto accettate, mentre con tentativi ripetuti e progressivamente intensificati la quota scende allo 0,20%. Nel caso della persuasione politica con Qwen3-8B, l’addestramento su dati di rifiuto completati tramite Escalate porta il tasso di rifiuto nel dominio bersaglio dal 9,47% all’84,75% e riduce dal 26,26% allo 0,14% il tasso medio di risposte non sicure su tre benchmark più ampi relativi alla dannosità, ma fa salire dal 2,00% al 74,00% il tasso di rifiuti ingiustificati su XSTest. In un confronto separato a parità di condizioni, sostituire le risposte esterne con risposte verificate del modello bersaglio riduce i rifiuti ingiustificati dal 15,20% al 5,20%. I dati costituiti da coppie ai due lati del confine riducono i rifiuti ingiustificati, per le richieste delle coppie tenute da parte a cui il modello dovrebbe rispondere, dal 32,94% al 4,16%, mentre il tasso di rifiuto delle richieste dannose scende soltanto dal 91,88% all’87,72%. Questi risultati mostrano che la composizione dei dati determina il compromesso tra sicurezza e usabilità e che l’allineamento per la sicurezza dovrebbe essere valutato su entrambi i lati del confine di rifiuto previsto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv