Vai al contenuto
AI.info

Etica e governance

IA e privacy: il patto della sorveglianza al cuore dell’economia dell’intelligenza

La principale sanzione europea in materia di privacy dell’IA è stata annullata nel marzo 2026, e il più ingente pagamento nel settore dell’IA finora ha riguardato libri piratati, non dati personali. Perché le misure di controllo arrivano qu

IA e privacy: il patto della sorveglianza al cuore dell’economia dell’intelligenza

Gabriele Masetti ·

Il patto che nessuno ha firmato

Ogni discussione su «IA e privacy» finisce per ricorrere alla parola patto, come se da qualche parte ci fosse stata una trattativa. Non c’è stata. L’economia dell’intelligenza è stata costruita raccogliendo dati dal web pubblico, acquistando licenze per ciò che non si poteva raccogliere senza dare nell’occhio e chiedendo perdono — in tribunale, nelle comunicazioni alle autorità di regolamentazione, in qualche occasionale accordo transattivo a nove cifre — solo dopo che i modelli erano già stati addestrati e distribuiti.

Le persone le cui fotografie, i cui scritti e i cui dati biometrici sono diventati materiale per l’addestramento non erano parti di questo patto. Erano la sua materia prima. Il modo più onesto di descrivere l’accordo non è chiamarlo patto, ma fatto compiuto, che autorità di regolamentazione e tribunali stanno ora cercando, lentamente e in modo disomogeneo, di dotare retroattivamente di consenso.

Questo tentativo sta fallendo in un modo preciso e riconoscibile: le sanzioni arrivano tardi, ammontano a una frazione del valore già estratto e raramente costringono qualcuno a cancellare un modello addestrato o a fargli dimenticare ciò che ha memorizzato. Finché le misure di controllo non potranno raggiungere il modello stesso — e non soltanto il dataset o la pratica che lo ha prodotto — il patto della sorveglianza continuerà a favorire chi raccoglie i dati per primo.

Prima la raccolta dei dati, poi le cause

L’esempio più chiaro è The New York Times Company v. Microsoft Corporation and OpenAI, causa intentata nel dicembre 2023 nel Distretto meridionale di New York. Il Times sostiene che OpenAI e Microsoft abbiano usato senza autorizzazione milioni di suoi articoli per addestrare i modelli GPT e che ChatGPT possa riprodurre articoli giornalistici del Times quasi parola per parola. Nel marzo 2025 il giudice Sidney Stein ha respinto gran parte della richiesta dei convenuti di archiviare la causa, consentendo alle principali contestazioni per violazione del diritto d’autore di proseguire, pur restringendo alcune contestazioni basate sul DMCA.

La fase di acquisizione delle prove ha dato luogo a una lunga disputa sui registri di ChatGPT: i ricorrenti ne volevano 120 milioni; nel novembre 2025 la giudice istruttore Ona Wang ha ordinato la consegna di un campione di 20 milioni di registri, privati degli identificativi personali, una decisione confermata dal giudice Stein nel gennaio 2026. Entro settembre 2026 tutte e tre le parti avevano chiesto una sentenza sommaria e il 17 settembre le memorie sono state rese pubbliche, in gran parte senza omissis. Ne è emersa la presenza di oltre 91.000 copie di lavori del Times, del Daily News e del Center for Investigative Reporting nei dataset usati da OpenAI nella fase intermedia dell’addestramento, insieme al giudizio di un direttore di Microsoft su questa pratica:

il più grande furto di lavoro nella storia dell’umanità — Brent Hecht, direttore della scienza applicata, Microsoft

Due settimane prima, il Dipartimento di Giustizia aveva depositato una memoria invitando il tribunale a stabilire che l’addestramento su testi protetti dal diritto d’autore costituisce fair use, richiamando la competitività americana e la sicurezza nazionale. Era la prima volta che il governo federale prendeva posizione in una causa sui dati di addestramento dell’IA, e si è schierato dalla parte dei convenuti.

Non è stato riportato alcun accordo transattivo. Si è invece allungata la fila delle cause: il Seattle Times e Newsday hanno citato in giudizio entrambe le aziende all’inizio di settembre 2026, e Times Publishing ha intentato una causa nel Distretto meridionale di New York il 16 settembre. Un’azienda che ha prima costruito un prodotto da mille miliardi di dollari sta ora negoziando, sotto mandato di comparizione e con il governo che sostiene le sue ragioni, quanto doveva alle persone di cui ha usato il lavoro.

Getty Images v. Stability AI ha seguito lo stesso copione, con un esito più scoraggiante per i titolari dei contenuti. Getty sosteneva che 7,3 milioni delle sue immagini fossero state usate per addestrare Stable Diffusion v1 e 4,4 milioni per addestrare v2. Ma, non potendo dimostrare che l’addestramento stesso fosse avvenuto nel Regno Unito, prima delle arringhe finali ha rinunciato alle sue principali contestazioni relative al diritto d’autore e ai diritti sulle banche dati.

Nella sentenza del novembre 2025, l’Alta Corte d’Inghilterra e Galles ha stabilito che i pesi di Stable Diffusion non sono «copie in violazione» ai sensi della legge britannica sul diritto d’autore — il modello conserva parametri ottenuti dall’addestramento statistico, non riproduzioni delle fotografie — benché Getty abbia vinto su una circoscritta contestazione relativa al marchio, riguardante output che riproducevano la filigrana di Getty. Letti insieme, i due casi mostrano la direzione che sta prendendo il diritto: i tribunali sono molto più disposti a intervenire su ciò che un modello produce che su ciò che è stato usato per addestrarlo. Dal punto di vista della privacy, questa asimmetria è esattamente il contrario di ciò che servirebbe, perché il danno della raccolta di dati senza consenso si verifica quando i dati vengono acquisiti, non quando il modello genera un risultato.

Dato Quantità
Immagini che, secondo Getty, sono state usate per addestrare Stable Diffusion v1 7,3 milioni
Immagini che, secondo Getty, sono state usate per addestrare Stable Diffusion v2 4,4 milioni
Registri di ChatGPT richiesti dai ricorrenti (causa NYT) 120 milioni
Campione di registri di ChatGPT ordinato dal tribunale 20 milioni

I dati biometrici sono il punto più delicato dello scambio

Testi e immagini, in linea di principio, si possono recuperare da fonti pubbliche. Non si può invece scegliere di smettere di rendere pubblico il proprio volto. È per questo che i dati biometrici hanno portato alle sanzioni accertate più elevate nell’economia dell’IA.

Clearview AI ha raccolto miliardi di fotografie dai social media e dal web aperto per costruire un database per il riconoscimento facciale, che ha venduto a dipartimenti di polizia e aziende private. In Illinois — l’unico Stato dotato di una legge, il Biometric Information Privacy Act (BIPA), che riconosce ai privati il diritto di agire in giudizio contro la raccolta di dati biometrici senza consenso — l’ACLU ha fatto causa a Clearview nel 2020.

L’accordo del 2022 vieta permanentemente a Clearview di vendere il suo database di impronte facciali alla maggior parte delle aziende private in tutto il Paese e, per cinque anni, di venderlo alla polizia in Illinois. Prevede inoltre un meccanismo che consente ai residenti dell’Illinois di escludere i propri dati. I pagamenti diretti sono stati modesti: 50.000 dollari per pubblicizzare il programma di esclusione e 250.000 dollari per le spese legali. Il valore dell’accordo era strutturale, non finanziario: anziché attribuire un prezzo al danno, poneva vincoli al modello di business di Clearview.

Il vero potere deterrente del BIPA si è manifestato altrove. Nel 2021 Facebook ha pagato 650 milioni di dollari per chiudere una class action basata sul BIPA relativa a Tag Suggestions, la sua funzione che creava modelli dei volti: all’epoca era il più grande accordo transattivo in una class action sulla privacy nella storia degli Stati Uniti. Il Texas, che ha una propria legge sui dati biometrici, il Capture or Use of Biometric Identifier Act, l’ha usata nel 2024 per ottenere da Meta un accordo da 1,4 miliardi di dollari per la stessa pratica di riconoscimento facciale: il più grande accordo sulla privacy mai ottenuto dal procuratore generale di uno Stato.

Entrambi i casi confermano lo schema: la responsabilità prevista dalla legge per ogni singola violazione, senza l’obbligo di dimostrare un danno individuale, è l’unico meccanismo che abbia prodotto sanzioni abbastanza elevate da cambiare davvero il comportamento delle aziende, anziché essere semplicemente assorbite come costi di esercizio.

Caso Importo Stato
Anthropic / autori (Bartz) 1,5 miliardi di dollari Approvazione definitiva, 20 luglio 2026
Meta / Texas (CUBI) 1,4 miliardi di dollari Accordo raggiunto nel 2024
Facebook / BIPA 650 milioni di dollari Accordo raggiunto nel 2021
Clearview AI / UK ICO 7,5 milioni di sterline Contestata dal 2022, rinviata a ottobre 2025
Clearview AI / Illinois (ACLU) 50.000 + 250.000 dollari Accordo raggiunto nel 2022
OpenAI / Garante italiano 15 milioni di euro Annullata dal Tribunale di Roma, 18 marzo 2026

Nel Regno Unito, la vicenda Clearview è stata più complicata e mostra i limiti del GDPR quando un’azienda non ha una presenza locale. Nel 2022 l’Information Commissioner’s Office (ICO) ha inflitto a Clearview una multa di 7,5 milioni di sterline per aver trattato illecitamente i dati dei residenti nel Regno Unito. Clearview ha presentato ricorso contestando la giurisdizione e nel 2023 il First-tier Tribunal le ha dato ragione, stabilendo che la sua attività non rientrava nell’ambito di applicazione del GDPR perché serviva clienti esteri delle forze dell’ordine e della sicurezza nazionale.

L’ICO ha impugnato la decisione e nell’ottobre 2025 l’Upper Tribunal l’ha ribaltata su tre dei quattro motivi, stabilendo che l’ICO ha effettivamente giurisdizione. Ha però rinviato a un nuovo collegio del First-tier Tribunal la questione della validità della sanzione. Nel dicembre 2025 ha autorizzato Clearview a portare la questione della giurisdizione davanti alla Court of Appeal: l’udienza di rinvio dovrà quindi attendere l’esito di un altro ricorso.

A quattro anni di distanza, non è ancora stato deciso se Clearview debba pagare. Una sanzione che impiega mezzo decennio a diventare definitiva, nei confronti di un’azienda che nel frattempo ha continuato a operare senza interruzioni, non è un deterrente. È un errore di arrotondamento a cui si aggiungono le spese legali.

Il ripiegamento dei divieti sul riconoscimento facciale

I divieti comunali sull’uso del riconoscimento facciale da parte della polizia — San Francisco è stata la prima, nel 2019, seguita da circa una dozzina di altre città entro il 2021 — hanno smesso di diffondersi. Nessuna nuova città ha approvato un divieto nel 2022 o nel 2023, e New Orleans ha abrogato il proprio nel luglio 2022. La stessa polizia di San Francisco è stata citata in giudizio con l’accusa di aver aggirato il divieto chiedendo ad agenzie dei territori vicini di effettuare ricerche tramite riconoscimento facciale per suo conto.

L’attenzione si è spostata dai divieti comunali assoluti alle garanzie introdotte a livello statale: alla fine del 2024 circa quindici Stati avevano leggi che limitavano l’uso del riconoscimento facciale da parte della polizia, e sia il Montana (2023) sia lo Utah (2024) avevano introdotto l’obbligo di un mandato. È un miglioramento reale rispetto a una situazione priva di regole, ma l’obbligo di un mandato è un controllo procedurale, non un divieto: presuppone che la tecnologia sia legittima purché un giudice dia il proprio assenso, eludendo la questione più profonda, cioè se un’infrastruttura di sorveglianza biometrica debba esistere su scala comunale o per i consumatori.

Lo strumento più drastico dell’Europa

Il GDPR dell’UE, e in particolare il Garante italiano, hanno mostrato che cosa accade quando un’autorità di controllo è disposta a usare subito il suo strumento più dirompente, anziché attendere anni di contenzioso. Il 30 marzo 2023 il Garante ha ordinato a OpenAI di interrompere immediatamente il trattamento dei dati personali degli utenti italiani, citando l’assenza di una base giuridica per l’uso di dati personali nell’addestramento di ChatGPT, informative insufficienti sulla trasparenza, risposte inesatte su persone reali e la mancanza di un’efficace verifica dell’età.

OpenAI ha ripristinato il servizio il 28 aprile, dopo aver accettato di introdurre informative sulla trasparenza, un meccanismo di verifica dell’età e un meccanismo che consentisse ai residenti nell’UE di opporsi all’uso dei loro dati nell’addestramento. Il blocco è durato meno di un mese, ma ha imposto modifiche concrete al prodotto in tutta l’UE, non solo in Italia: l’opposto della battaglia contro Clearview, durata anni e circoscritta a singole giurisdizioni.

Nel dicembre 2024 il Garante ha annunciato una multa di 15 milioni di euro a OpenAI per le stesse violazioni relative ai dati di addestramento, insieme all’ordine di condurre una campagna di sensibilizzazione sulla stampa italiana. Nessuna delle due misure è rimasta in vigore. Il 18 marzo 2026 il Tribunale di Roma le ha annullate entrambe per una sola questione di competenza: OpenAI aveva aperto una sede in Irlanda nel febbraio 2024 e, in base alla regola dello sportello unico del GDPR, l’autorità irlandese era diventata la sua autorità di controllo capofila nove mesi prima che la decisione italiana fosse firmata.

Il tribunale non si è pronunciato sulla liceità dell’addestramento. Ha stabilito che l’Italia non era più l’autorità competente a porre la questione. In Europa non c’è ora alcuna multa in vigore contro un laboratorio di frontiera per le sue pratiche relative ai dati di addestramento, ed è stata dimostrata una via per evitarne una: costituire una società in uno Stato membro di propria scelta mentre l’indagine è in corso. Il blocco d’urgenza, disposto nel giro di settimane, resta l’unica misura europea ad aver cambiato il prodotto di OpenAI.

La macchina ricorda ciò che le è stato detto di non ricordare

Una regolamentazione rivolta soltanto alle pratiche di raccolta dei dati trascura un secondo problema di privacy che risiede nel modello addestrato: la memorizzazione. L’articolo del 2021 di Carlini et al. per USENIX Security, «Estrazione dei dati di addestramento dai grandi modelli linguistici», ha mostrato che interrogare GPT-2 con i prefissi giusti poteva far emergere testo memorizzato parola per parola, compresi nomi, numeri di telefono e indirizzi email di persone presenti nei dati di addestramento.

Ricerche successive sui sistemi in produzione hanno rilevato che il problema cresce con le dimensioni e le capacità dei modelli, anziché scomparire: i modelli più grandi e capaci memorizzano di più, e le tecniche di prompt avversari (caratteri speciali usati come innesco, attacchi mirati basati sui prefissi, verifiche per inferire se un dato fosse presente nell’addestramento) hanno tenuto il passo con le misure di mitigazione. Alcune analisi hanno rilevato che, per singola interrogazione, estrarre contenuti dai modelli più recenti adattati alla conversazione è più difficile che dai modelli di base non adattati. Ma quando l’estrazione riesce su larga scala contro sistemi in produzione, fa emergere contenuti memorizzati molto più spesso di quanto accadesse con gli attacchi precedenti, più rudimentali.

In altre parole: l’adattamento dei modelli per allinearne il comportamento ha cambiato le probabilità di riuscita di ciascun tentativo, non il fatto di fondo che questi modelli conservano frammenti recuperabili dei dati personali su cui sono stati addestrati.

Questo conta perché vanifica il rimedio standard per la tutela della privacy: la cancellazione. Se i dati di una persona sono memorizzati nei pesi di un modello, anziché conservati in un database interrogabile, non esiste un modo semplice per «rimuoverli» senza riaddestrare il modello: un’operazione costosa, talvolta non ancora dimostrata sul piano tecnico, soprattutto alla scala dei modelli di frontiera. Il diritto alla cancellazione previsto dal GDPR e quello previsto dal CCPA sono stati concepiti per i database, non per parametri distribuiti fra miliardi di pesi. Nessuno ha dimostrato su larga scala che sia possibile far «dimenticare» in modo affidabile a un modello addestrato i dati di una persona specifica senza riaddestrarlo da zero.

Privacy differenziale: reale, ma parziale

La soluzione tecnica che funziona davvero, entro i suoi limiti, è la privacy differenziale: aggiungere durante l’addestramento un rumore statistico calibrato, in modo che nessun singolo esempio di addestramento possa essere recuperato in modo affidabile dalle risposte del modello. La forza della garanzia è regolata da un parametro chiamato epsilon: un epsilon più piccolo significa maggiore tutela della privacy, uno più grande significa minore tutela. Apple applica la privacy differenziale, con valori di epsilon indicati all’incirca nell’intervallo 2–8 a seconda del tipo di dati, alla telemetria d’uso che raccoglie da iPhone e Mac.

Google addestra i modelli di previsione della tastiera Gboard usando la discesa stocastica del gradiente con privacy differenziale e indica un epsilon intorno a 8,9 per i cicli di apprendimento federato: lo fa proprio per evitare che le abitudini di digitazione dei singoli utenti vengano memorizzate nel modello condiviso. Sono difese reali, già impiegate e verificabili, e vanno nella direzione giusta.

Non sono però quelle su cui si basano i grandi modelli linguistici di frontiera addestrati su testi raccolti dal web, perché applicare la privacy differenziale alla scala e con i valori di epsilon necessari per una garanzia significativa peggiora in modo misurabile la qualità del modello. È proprio per questo che oggi i più grandi modelli generativi di OpenAI, Anthropic e Google non vengono addestrati in questo modo. La privacy differenziale protegge gli utenti dei prodotti progettati appositamente per tutelarla. Non protegge gli autori, gli artisti e le persone comuni i cui testi e immagini sono stati raccolti per addestrare un modello generalista che non è mai stato progettato tenendo conto di un limite prestabilito alla perdita di privacy.

Perché le multe non scoraggiano nessuno

Basta mettere in fila le cifre per vedere emergere uno schema. In circa un decennio, un settore che vale oltre mille miliardi di dollari ha prodotto una transazione da 1,5 miliardi di dollari (Anthropic, per libri piratati anziché per dati personali, approvata definitivamente il 20 luglio 2026), una da 1,4 miliardi di dollari (Meta/Texas), una da 650 milioni di dollari (Facebook/BIPA), una multa contestata da 7,5 milioni di sterline che risale a quattro anni fa e non è stata pagata (Clearview/Regno Unito) e una multa da 15 milioni di euro che non esiste più (OpenAI/Italia).

La transazione di Anthropic è quella che più si è avvicinata a colpire il prodotto anziché la condotta: ha obbligato l’azienda a distruggere i file piratati che aveva scaricato, lasciando intatti i modelli addestrati su quei file.

Solo i due casi sui dati biometrici, fondati su risarcimenti previsti dalla legge, hanno raggiunto cifre abbastanza alte da poter plausibilmente fungere da deterrente anziché da semplice costo d’impresa. Entrambi, però, dipendevano da leggi statali insolitamente severe (la BIPA dell’Illinois e la CUBI del Texas), che la maggior parte degli stati non ha. Il massimale previsto dal GDPR — fino al 4% del fatturato annuo globale o 20 milioni di euro, a seconda di quale sia la cifra più alta — non è mai stato applicato a un laboratorio di IA di frontiera per le sue pratiche relative ai dati di addestramento. L’unica multa che vi si è avvicinata ammontava a una frazione di quel massimale ed è stata annullata per una questione procedurale prima che ne fosse pagato un solo euro.

Che cosa servirebbe per un vero patto

Il filo conduttore di tutti questi casi — NYT, Getty, Clearview, Facebook, Meta, Italia — è che le autorità intervengono sempre dopo che il modello è stato costruito, addestrato, distribuito e monetizzato, e continuano ad accontentarsi di sanzioni calibrate per sembrare severe in un comunicato stampa, non per mettere a rischio il modello di business.

Un vero patto richiederebbe tre cose che finora le autorità di regolamentazione hanno evitato: estendere ben oltre due stati i risarcimenti stabiliti per legge per ogni violazione, sul modello della BIPA e della CUBI, così che la raccolta di dati biometrici e di altri dati personali sensibili comporti un rischio finanziario concreto prima del lancio di un prodotto, non dopo; riconoscere il diritto di imporre il riaddestramento o la cancellazione di un modello di cui sia dimostrato che memorizza dati personali identificabili, così che «non possiamo tornare indietro» smetta di essere una difesa accettata; e rendere obbligatorio dichiarare la provenienza dei dati di addestramento prima della distribuzione, anziché dopo anni di procedimenti giudiziari per l’acquisizione delle prove, così da rendere superflua una battaglia pluriennale come quella del NYT su quali dati siano stati usati per addestrare un modello.

La privacy differenziale dimostra che il settore sa costruire sistemi che tutelano la privacy quando il modello economico di un prodotto può assorbire la perdita di utilità. Manca un meccanismo di applicazione delle norme che costringa i laboratori a sostenere quel costo quando è scomodo farlo — cosa che, per i modelli di frontiera addestrati sull’intero internet rastrellato, al momento accade sempre. Finché questo non cambierà, «patto» resterà la parola sbagliata. È una tassa, e il pubblico la paga senza che nessuno gli abbia mai detto quale sia l’aliquota.

Esplora

Altri articoli