Ricerca
Eliminare il contenuto informativo non certifica la resistenza alle manomissioni nei modelli a pesi aperti
Eliminare le informazioni dannose rende i modelli a pesi aperti resistenti agli attacchi tramite fine-tuning? Dimostriamo che la sola informazione mutua al momento del rilascio non può certificare in

- arXiv
- 2610.09004
- Pubblicato
- 2026-10-06
- Autori
- Domenic Rosati, Alessa Carbo, Ali Dadsetan, Hong Huang, Matthew Young, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad
Abstract degli autori
Eliminare le informazioni dannose rende i modelli a pesi aperti resistenti agli attacchi tramite fine-tuning? Dimostriamo che la sola informazione mutua al momento del rilascio non può certificare in modo universale che il recupero sarà lento. Le riparametrizzazioni che preservano la funzione lasciano invariata l’informazione, ma modificano la geometria della discesa del gradiente: una certificazione invariante è quindi limitata dalla più rapida tra le parametrizzazioni raggiungibili. Applichiamo questo principio all’informazione mutua tra pesi e dati nel filtraggio dei dati di addestramento e all’informazione mutua tra etichette e rappresentazioni nella rimozione delle capacità. L’ordine dell’addestramento può cambiare il tempo di recupero a parità di informazione tra pesi e dati, mentre un’indipendenza esatta a livello di rappresentazioni può preservare l’intera matrice jacobiana rispetto ai parametri. In una costruzione esplicita, entrambe le quantità di informazione sono pari a zero e il recupero avviene in un solo passo di discesa del gradiente. Esperimenti controllati illustrano come il recupero dipenda dall’ordine dell’addestramento e la velocità dell’attacco dalla parametrizzazione. Questi risultati individuano ciò che manca per ottenere una certificazione: vincoli sulla dinamica dell’attacco che vadano oltre l’informazione mutua al momento del rilascio.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv