Vai al contenuto
AI.info

Ricerca

Eliminare il contenuto informativo non certifica la resistenza alle manomissioni nei modelli a pesi aperti

Eliminare le informazioni dannose rende i modelli a pesi aperti resistenti agli attacchi tramite fine-tuning? Dimostriamo che la sola informazione mutua al momento del rilascio non può certificare in

Eliminare il contenuto informativo non certifica la resistenza alle manomissioni nei modelli a pesi aperti
arXiv
2610.09004
Pubblicato
2026-10-06
Autori
Domenic Rosati, Alessa Carbo, Ali Dadsetan, Hong Huang, Matthew Young, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad

Abstract degli autori

Eliminare le informazioni dannose rende i modelli a pesi aperti resistenti agli attacchi tramite fine-tuning? Dimostriamo che la sola informazione mutua al momento del rilascio non può certificare in modo universale che il recupero sarà lento. Le riparametrizzazioni che preservano la funzione lasciano invariata l’informazione, ma modificano la geometria della discesa del gradiente: una certificazione invariante è quindi limitata dalla più rapida tra le parametrizzazioni raggiungibili. Applichiamo questo principio all’informazione mutua tra pesi e dati nel filtraggio dei dati di addestramento e all’informazione mutua tra etichette e rappresentazioni nella rimozione delle capacità. L’ordine dell’addestramento può cambiare il tempo di recupero a parità di informazione tra pesi e dati, mentre un’indipendenza esatta a livello di rappresentazioni può preservare l’intera matrice jacobiana rispetto ai parametri. In una costruzione esplicita, entrambe le quantità di informazione sono pari a zero e il recupero avviene in un solo passo di discesa del gradiente. Esperimenti controllati illustrano come il recupero dipenda dall’ordine dell’addestramento e la velocità dell’attacco dalla parametrizzazione. Questi risultati individuano ciò che manca per ottenere una certificazione: vincoli sulla dinamica dell’attacco che vadano oltre l’informazione mutua al momento del rilascio.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv