Vai al contenuto
AI.info

The Pulse

Atti desecretati mostrano che OpenAI e Microsoft consideravano le notizie una minaccia

Atti giudiziari desecretati rivelano che, all’interno di OpenAI e Microsoft, si temeva che i prodotti di IA potessero sostituire gli editori di notizie e danneggiare l’offerta di contenuti giornalistici sul web. I documenti descrivono inolt

Atti desecretati mostrano che OpenAI e Microsoft consideravano le notizie una minaccia

AI.info Team ·

«Il più grande furto di lavoro nella storia dell’umanità.»

Brent Hecht, direttore della scienza applicata di Microsoft, come citato in un atto giudiziario desecretato

Il dibattito interno a Microsoft e OpenAI sullo scraping delle notizie è diventato pubblico il 17 settembre, quando un tribunale federale ha desecretato parti di un’istanza di giudizio sommario presentata da organizzazioni giornalistiche guidate da The New York Times. I documenti citati nell’istanza descrivono dirigenti e ricercatori preoccupati che i prodotti di IA addestrati sul giornalismo potessero danneggiare gli editori il cui lavoro alimentava quei sistemi.

Gli atti fanno parte della causa per violazione del copyright intentata da The New York Times e altre organizzazioni giornalistiche contro OpenAI e Microsoft. Non chiariscono se la condotta delle aziende rientri nel fair use. Rivelano però dichiarazioni interne che, secondo gli editori, contraddicono la tesi sostenuta dalle aziende in tribunale, secondo cui l’addestramento dei modelli è trasformativo e prodotti come ChatGPT e Copilot non sostituiscono i siti di notizie.

L’avvertimento di Microsoft sul «circolo vizioso»

Secondo l’istanza degli editori, Hecht, direttore della scienza applicata di Microsoft, ha descritto la copiatura di notizie per l’addestramento dell’IA come «un furto sbalorditivo e di proporzioni senza precedenti» e forse «il più grande furto di lavoro nella storia dell’umanità». In un altro documento ha scritto che considerare questa pratica fair use sarebbe «una completa presa in giro dell’idea di “fair use”».

Un documento separato di Microsoft metteva in guardia da un «circolo vizioso» in cui i prodotti di IA avrebbero indebolito la base economica degli editori che fornivano il materiale per il loro addestramento. «È molto insolito che un prodotto finale minacci le basi economiche dei suoi fornitori essenziali», si leggeva nel documento, «ma è questa la situazione che abbiamo creato per la nostra attività nel settore degli LLM rispetto alla sua “catena di approvvigionamento dei contenuti”».

I dati interni di Microsoft, così come presentati nell’istanza, mostravano un calo dei tassi di clic dall’83% al 93% per alcuni editori ricorrenti e dal 51% al 94% per altri. Gli editori sostengono che queste cifre avvalorino la loro tesi secondo cui le risposte dei chatbot e le funzioni di ricerca basate sull’IA possono sostituire le visite ai siti originali.

I messaggi di OpenAI descrivono la sostituzione

Nei messaggi interni di OpenAI emergeva una preoccupazione simile. Nick Turley, indicato nell’atto come responsabile di ChatGPT, ha scritto che gli editori si trovavano di fronte a una «minaccia esistenziale» da parte di prodotti commerciali addestrati sul loro lavoro. Ha definito i prodotti «in gran parte sostitutivi, punto» e previsto che sarebbero diventati sempre più sostitutivi con il loro miglioramento.

Un altro dipendente di OpenAI ha scritto che gli utenti non avrebbero cliccato nemmeno se i chatbot avessero mostrato link ben visibili. Turley ha concordato che non ci fosse «nessun buon motivo per cliccare» se un chatbot forniva direttamente le informazioni richieste. Anche Satya Nadella, CEO di Microsoft, ha testimoniato che l’IA conversazionale aveva sostituito i siti degli editori, fornendo informazioni all’interno del prodotto di IA anziché indirizzare gli utenti alla fonte originale.

Il ricercatore Nick Ryder ha riferito al presidente di OpenAI, Greg Brockman, che l’azienda aveva trovato «un trucco» per aggirare il paywall di The New York Times con i suoi crawler. Secondo l’istanza, Brockman ha risposto: «Ah, bene».

Project Mango e la portata della copiatura

Gli atti descrivono scambi di dati tra le due aziende. OpenAI ha fornito a Microsoft l’intero dataset di addestramento di GPT-3, così che Microsoft potesse valutare come usare i modelli di OpenAI nei prodotti commerciali. Microsoft, a sua volta, ha fornito dati di addestramento a OpenAI attraverso progetti chiamati Project Taxi e Project Mango.

Gli editori affermano che Project Mango conteneva copie di almeno 160.903 opere uniche di organizzazioni giornalistiche. Sostengono inoltre che Microsoft abbia venduto o riutilizzato dati raccolti per Bing, mentre OpenAI avrebbe ottenuto da terzi un dataset contenente 1,8 milioni di articoli di New York Times, nonostante le restrizioni che ne vietavano l’uso commerciale.

L’istanza sostiene inoltre che OpenAI abbia creato sistemi per rimuovere le note sul copyright dai dati di addestramento, perché i ricercatori non volevano che i modelli le riportassero nelle loro risposte. I ricorrenti affermano anche che le aziende abbiano creato filtri per sopprimere i contenuti degli editori che avevano intentato una causa, lasciando meno limitati quelli di altre organizzazioni. Hecht ha descritto il risultato come un «insabbiamento accidentale».

Microsoft distingue la testimonianza dalla posizione aziendale

Microsoft contesta l’interpretazione degli editori. Un portavoce dell’azienda ha dichiarato ad Ars Technica che la testimonianza di Nadella riguardava cambiamenti generali nel modo in cui le persone trovano e fruiscono le informazioni e non dovrebbe essere considerata una conclusione sulle questioni di copyright sottoposte al tribunale.

L’azienda ha inoltre affermato che i commenti di Hecht riflettevano «il punto di vista personale di un singolo dipendente», non costituivano un’analisi giuridica e non rappresentavano la posizione di Microsoft. Microsoft sostiene che l’addestramento dell’IA rientri nel fair use e che Copilot non sostituisca il lavoro giornalistico degli editori. OpenAI non ha risposto alla richiesta di commento di Ars Technica.

Steven Lieberman, legale di New York Daily News e di sette testate a esso collegate, ha affermato che il materiale reso pubblico di recente dimostrava che OpenAI e Microsoft sapevano che la loro condotta era sbagliata. Le aziende hanno sostenuto che i documenti dovessero rimanere riservati; con l’ordine di desecretazione, il tribunale ha ora reso pubblici gli avvertimenti interni.

La questione giuridica immediata è se le dichiarazioni e i dati sul traffico convinceranno il tribunale che l’uso dei contenuti giornalistici da parte delle aziende abbia danneggiato il mercato delle opere originali. Gli editori chiedono una sentenza su un gruppo più ristretto di articoli per i quali, a loro dire, le risposte dei chatbot presentano ampie sovrapposizioni testuali letterali. Le controversie restanti confluiranno nella più ampia battaglia sul copyright relativa a come OpenAI e Microsoft abbiano ottenuto, scambiato e utilizzato il materiale.

Fonte

Esplora

Altri articoli