Vai al contenuto
AI.info

The Pulse

I ricercatori estraggono reti neurali addestrate da etichette hard

Un nuovo studio dimostra l’estrazione end-to-end di reti ReLU addestrate usando solo le etichette di output ottenute da query a scatola nera. Il metodo raggiunge una concordanza delle etichette pari ad almeno il 98,477% sui modelli testati

I ricercatori estraggono reti neurali addestrate da etichette hard

AI.info Team ·

I ricercatori hanno dimostrato un attacco completamente a scatola nera che ricostruisce reti neurali addestrate, osservando soltanto l’etichetta della classe finale restituita per ogni query. Il metodo ha estratto reti ReLU con quattro e sei strati nascosti, addestrate con MNIST e Fashion-MNIST, ottenendo una concordanza compresa tra il 98,477% e il 100% con i modelli bersaglio su 100.000 input di valutazione.

Akira Ito, Takayuki Miura e Yosuke Todo descrivono la tecnica in un articolo inviato ad arXiv il 18 settembre 2026. Il loro lavoro affronta la versione più difficile dell’estrazione di modelli neurali: l’attaccante riceve etichette come «cane» o «gatto», ma non punteggi di confidenza, logits o attivazioni nascoste.

Le etichette hard rivelano più di quanto sembri

Gli attacchi di estrazione dei modelli mirano a riprodurre una rete neurale distribuita, avendo accesso alle sue previsioni. In genere i fornitori considerano proprietari i parametri addestrati, perché per ottenerli servono dati, capacità di calcolo e competenze ingegneristiche considerevoli. Un modello estratto può rivelare il comportamento di un servizio senza dare all’attaccante accesso diretto ai suoi file.

I ricercatori si concentrano su perceptroni multistrato completamente connessi, con strati nascosti ReLU e uno strato di output affine. L’attacco presuppone che l’avversario conosca l’architettura della rete, possa inviare input arbitrari e ottenere previsioni sufficientemente precise dal sistema bersaglio. Durante l’estrazione viene usata soltanto l’etichetta della classe vincente.

Le reti ReLU suddividono lo spazio degli input in regioni in cui la rete si comporta come una funzione affine. I confini tra queste regioni cambiano quando i singoli neuroni passano dallo stato attivo a quello inattivo, o viceversa. L’attacco cerca i punti in cui il confine di attivazione di un neurone interseca quello che separa due classi di output. Queste intersezioni rivelano informazioni geometriche sullo strato nascosto.

Il metodo del coseno elimina il collo di bottiglia più difficile

I precedenti metodi di estrazione basati su etichette hard usavano una procedura di esplorazione dei confini per risolvere un’ambiguità sulla direzione dei pesi dei neuroni recuperati. La procedura richiedeva query ripetute, l’individuazione dei cambiamenti nel confine decisionale e ulteriori stime numeriche. Secondo l’articolo, realizzare un’implementazione pratica a scatola nera era difficile, perché gli errori potevano sembrare cambiamenti reali della rete.

Ito, Miura e Todo sostituiscono questa procedura con una serie di calcoli offline chiamata metodo del coseno. Il metodo confronta le similarità coseno tra la firma di un neurone recuperata e i vettori normali dei confini decisionali vicini. Riutilizza gli spazi di intersezione già raccolti per recuperare le firme, quindi il recupero del segno non richiede query dedicate.

Negli esperimenti su un modello addestrato con MNIST, con cinque strati nascosti di ampiezza 128, sono stati recuperati i segni di 506 dei 510 neuroni testati usando 50 spazi di intersezione per neurone, escludendo i neuroni persistenti e quelli morti. Gli autori introducono inoltre versioni ponderate del calcolo per ridurre la distorsione causata dalla mappatura lineare locale della rete e dal bias direzionale nei modelli addestrati.

Quattro piccole reti mettono alla prova il metodo completo

L’attacco completo è rivolto a reti con 784 input, 10 output e strati nascosti composti ciascuno da 16 neuroni. I modelli hanno quattro o sei strati nascosti, vengono addestrati per 30 epoche con l’ottimizzatore Adam e classificano immagini di MNIST o Fashion-MNIST.

Per i modelli con quattro strati nascosti, i ricercatori raccolgono 20.000 spazi di intersezione per modello. Gli esperimenti con sei strati nascosti ne usano 400.000 per modello. La raccolta assorbe la maggior parte del budget di query; la fase di recupero dei segni riutilizza quegli spazi e non aggiunge query.

Gli input con distribuzione gaussiana standard permettono alle reti estratte di riprodurre con elevata concordanza le classificazioni dei modelli bersaglio. Il modello MNIST a quattro strati raggiunge il 98,477%, mentre quello a sei strati raggiunge il 99,948%. I corrispondenti modelli Fashion-MNIST raggiungono rispettivamente il 100,000% e il 99,744%.

L’articolo riferisce che sono stati recuperati tutti i neuroni, tranne quelli morti e quasi morti. Dopo aver abbinato e normalizzato le firme recuperate degli strati nascosti, la maggiore distanza L2 riportata dal corrispondente vettore dei pesi reale è stata 9,34 × 10-6.

L’attacco dipende ancora da un ampio budget di query

I risultati non dimostrano che qualsiasi servizio neurale distribuito possa essere copiato a basso costo. Gli esperimenti usano piccole reti ReLU completamente connesse e concedono all’attaccante accesso illimitato a input arbitrari. I moderni sistemi in produzione possono usare architetture diverse, imporre restrizioni agli input, limiti alle richieste, sistemi di monitoraggio o comportamenti randomizzati.

Anche il costo delle query resta un limite importante. Gli autori affermano che il loro metodo riduce le query aggiuntive necessarie per recuperare segni e firme, ma raccogliere un numero sufficiente di spazi di intersezione richiede comunque un numero considerevole di chiamate all’oracolo. Gli esperimenti con sei strati mostrano la portata del problema: prima di iniziare il recupero degli strati, per ciascun modello occorre raccogliere 400.000 spazi di intersezione.

Per i fornitori di modelli, il risultato ridimensiona la protezione offerta dal nascondere i punteggi di confidenza. Un servizio che restituisce solo l’etichetta principale espone meno informazioni di uno che restituisce logits o probabilità, ma l’articolo mostra che, nelle condizioni indicate, il solo accesso alle etichette può comunque consentire di recuperare i parametri.

Un risultato controllato con implicazioni dirette per la sicurezza

Lo studio dimostra la fattibilità del metodo, ma non prende di mira un servizio di IA commerciale specifico. I modelli bersaglio sono benchmark addestrati, non sistemi proprietari, e i ricercatori non sostengono che il metodo estragga modelli linguistici di grandi dimensioni o altre architetture al di fuori dell’ambito degli esperimenti.

Il risultato è importante perché colma una lacuna nei lavori precedenti. Era già stata proposta l’estrazione in tempo polinomiale basata su etichette hard, ma una dimostrazione completa su reti ReLU profonde addestrate restava difficile, a causa del recupero dei segni e delle informazioni geometriche mancanti o fuorvianti. La nuova procedura combina il recupero dei segni con metodi per scartare le firme spurie, recuperare le coordinate mancanti e gestire gli strati più profondi.

Gli autori indicano nella riduzione delle query il prossimo problema tecnico da affrontare. I loro esperimenti mostrano che le reti recuperate possono riprodurre fedelmente i modelli bersaglio, ma evidenziano anche dove l’attacco resta costoso: il sistema deve prima mappare una porzione sufficiente della geometria decisionale della rete bersaglio per ricostruirne la struttura nascosta.

Fonte

Esplora

Altri articoli