Vai al contenuto
AI.info

Ricerca

Violazione della privacy nell’addestramento split-LLM: il gradiente restituito vanifica le esche

Presentiamo uno studio di caso sulla sicurezza di un sistema di addestramento split-LLM a due nodi che ha superato la valutazione della privacy, pur lasciando non esaminato un canale osservabile. Il T

Violazione della privacy nell’addestramento split-LLM: il gradiente restituito vanifica le esche
arXiv
2609.04382
Pubblicato
2026-09-03
Autori
Georgios Politis, Evangelos Pappas

Abstract degli autori

Presentiamo uno studio di caso sulla sicurezza di un sistema di addestramento split-LLM a due nodi che ha superato la valutazione della privacy, pur lasciando non esaminato un canale osservabile. Il Trusted Local Node (TLN) invia attivazioni protette all’Untrusted Cloud Node (UCN), che restituisce il proprio output; il TLN, che dispone della funzione di perdita privata, restituisce il gradiente dell’output. Il frame ricevuto dall’UCN mescola righe reali e righe esca, ma la funzione di perdita ignora le esche. I loro gradienti sono esattamente pari a zero: la disposizione degli zeri rivela quindi quali righe erano reali. Misuriamo questa fuga di informazioni con un protocollo definito in anticipo: una fuga introdotta con intensità nota per dimostrare che lo strumento è in grado di rilevarla, un controllo con etichette rimescolate per dimostrare che non segnala fughe assenti e una soglia fissata prima delle esecuzioni. Con nove seed, gli zeri hanno identificato le righe reali in ogni frame: 4.096 su 4.096 per esecuzione. Un attacco ai contenuti dei frame ha recuperato circa un token in più ogni cento rispetto a una baseline basata su una previsione costante (da +0,65 a +1,50 punti percentuali); i controlli con etichette rimescolate non hanno recuperato nulla. Una seconda serie di esecuzioni ha ripetuto il risultato con una configurazione che mantiene la qualità del modello entro il budget previsto: il risultato non è dunque limitato a una configurazione che nessuno adotterebbe. Su entrambi i dataset, ogni esecuzione di questo tipo ha superato il controllo della privacy del canale di andata e quello della qualità, ma non ha superato lo stesso controllo della privacy una volta incluso il gradiente restituito. Applicare il clipping e aggiungere rumore a ciascuna riga del gradiente ha eliminato la fuga di informazioni, al costo di circa 0,01 nat di entropia incrociata su dati tenuti da parte. Questo non significa che il sistema sia sicuro: cinque classi di attacchi, comprese quelle che accumulano osservazioni nel corso dei passaggi di addestramento, non sono mai state misurate.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv