Vai al contenuto
AI.info

Ricerca

Attacchi di decodifica controllata ai LLM a scatola nera

Manipolare le probabilità del token successivo durante la generazione può aggirare l’allineamento dei modelli linguistici di grandi dimensioni in materia di sicurezza. Gli approcci esistenti, tuttavia

Attacchi di decodifica controllata ai LLM a scatola nera
arXiv
2609.36956
Pubblicato
2026-09-29
Autori
Jesson Wang, Shawn Li, Wei Yang, Franck Dernoncourt, Ryan A. Rossi, Charith Peris, Yue Zhao

Abstract degli autori

Manipolare le probabilità del token successivo durante la generazione può aggirare l’allineamento dei modelli linguistici di grandi dimensioni in materia di sicurezza. Gli approcci esistenti, tuttavia, richiedono l’accesso ai pesi del modello o ai valori numerici delle probabilità dei token e quindi non si applicano alle interfacce che restituiscono soltanto testo campionato. Ricostruire le probabilità a partire dagli output campionati offre una possibile alternativa, ma un numero finito di campioni produce stime sparse e rumorose, mentre ripetere il processo a ogni passaggio della generazione comporta un costo considerevole in termini di interrogazioni. Le nostre osservazioni empiriche suggeriscono che, lungo le traiettorie dei jailbreak riusciti, i cambiamenti più marcati nella distribuzione si concentrino in un piccolo sottoinsieme di posizioni: questo motiva un controllo selettivo. Presentiamo \method{}, un framework per effettuare jailbreak attraverso interfacce di continuazione che restituiscono solo testo e consentono il campionamento ripetuto e la continuazione a partire da un prefisso dell’assistente. Sample-Based Distribution Reconstruction combina gli output campionati con una distribuzione a priori sulle azioni non osservate per ottenere un segnale di controllo utilizzabile. Risk-Gated Residual Control usa il prefisso della risposta man mano che si forma per decidere quando ricostruire e modificare la distribuzione, concentrando i costi di campionamento in posizioni selezionate. Speculative Multi-Token Execution ammortizza ulteriormente le chiamate al modello bersaglio verificando e accettando prefissi proposti che non richiedono interventi. Su quattro endpoint bersaglio e tre benchmark, \method{} ottiene il punteggio medio più alto nella maggior parte dei confronti con i metodi di riferimento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv