controvversia dati training AI

Alcuni dipendenti Microsoft si sono chiesti, in documenti interni scritti nel 2023, se l’addestramento dei modelli di intelligenza artificiale su articoli giornalistici altrui equivalesse al “più grande furto di lavoro nella storia dell’umanità”. La frase, contenuta in memo aziendali finiti ora agli atti di un tribunale, riassume bene i nodi al centro della controversia dati training AI che da tre anni oppone editori, Microsoft e OpenAI davanti alla giustizia americana. Documenti giudiziari desecretati giovedì e ripresi da The New York Times mostrano quanto, dentro le due aziende, la questione fosse più controversa di quanto lasciassero intendere le difese pubbliche.

Punti chiave

  • Dipendenti Microsoft hanno discusso internamente se lo scraping di articoli da parte di OpenAI fosse “il più grande furto di lavoro nella storia dell’umanità”.
  • Memo interni parlavano di un “doom loop” capace di far peggiorare la qualità dei modelli costruiti insieme a OpenAI.
  • The New York Times ha citato in giudizio Microsoft e OpenAI a fine 2023, causa poi allargata a undici altri editori.
  • OpenAI è stata obbligata a conservare 20 milioni di log di conversazioni ChatGPT per il procedimento.
  • Il giudice Sidney Stein, della Corte distrettuale del Southern District di New York, sta valutando le richieste di giudizio sommario.

Le ammissioni interne su scraping e “furto di lavoro”

Nei documenti spunta un memo del 2023 in cui si legge: “milioni di persone in tutto il mondo considereranno presto i grandi modelli che aspirano tutto il loro lavoro come un furto sorprendente di proporzioni senza precedenti”. Lo stesso autore aggiungeva una frase ancora più dura: “i grandi modelli di AI sono un prodotto che distrugge la propria catena di fornitura”.

Microsoft ha precisato che quei memo sono opera di Brent Hecht, direttore di applied science con un ruolo anche accademico alla Northwestern University, e non rappresentano la posizione ufficiale dell’azienda. Secondo la società, Hecht non era un decisore e il suo compito era proprio quello di “presentare prospettive divergenti e asimmetriche” all’interno del dibattito interno.

Il “doom loop” e il crollo del traffico verso gli editori

I dati citati nei documenti mostrano un effetto concreto e misurabile: secondo materiale interno di Microsoft, il motore di risposta Copilot ha fatto crollare i click-through rate verso il dominio del New York Times fino al 93% rispetto alla normale ricerca su Bing. In una presentazione del gennaio 2024, sempre firmata da Hecht, questo fenomeno viene descritto come un “doom loop” destinato a “danneggiare le performance dei nostri modelli e dell’intero web allo stesso tempo”.

Il documento aggiunge che è “estremamente inusuale che un prodotto finale minacci le fondamenta economiche dei suoi fornitori essenziali”, ma è esattamente la situazione creata dal business degli LLM rispetto alla propria “catena di fornitura di contenuti”. Un altro documento Microsoft parla di un “rischio reale” che l’AI generativa possa “disturbare significativamente l’occupazione delle stesse persone che hanno generato i dati su cui il modello fondativo è stato addestrato”.

Perché conta: se anche i tecnici interni ammettono che i chatbot sostituiscono, e non solo integrano, i contenuti originali, l’argomento del fair use su cui si basa gran parte della difesa legale delle aziende AI diventa più fragile, perché uno dei criteri chiave di quella dottrina riguarda proprio l’assenza di danno al mercato dell’opera originale.

Il tentativo di aggirare il paywall del New York Times

Tra gli episodi più imbarazzanti emersi dai documenti c’è quello riguardante il paywall del quotidiano newyorkese. Un ricercatore OpenAI, secondo le carte, avrebbe segnalato al presidente Greg Brockman un “hack per superare il paywall del nytimes”. Brockman avrebbe risposto semplicemente: “bello”.

Le carte descrivono anche come OpenAI abbia costruito dataset come WebText e WebText2 basandosi in modo sproporzionato su contenuti giornalistici raccolti online, oltre a milioni di articoli estratti da Common Crawl, l’archivio pubblico di scansioni web. Nei documenti si parla pure dello sforzo deliberato di eliminare le note di copyright dai dati usati per l’addestramento, perché i ricercatori “non avrebbero voluto che il modello restituisse” agli utenti finali “avvisi di copyright”.

La scala dello scraping tra Microsoft e OpenAI

I numeri riportati nei documenti danno un’idea della portata dell’operazione. I dataset intermedi di addestramento di OpenAI conterrebbero oltre 91.692 copie di opere pubblicate da New York Times, Daily News e Center for Investigative Reporting. Un dataset derivato da Common Crawl includerebbe più di 2 milioni di documenti provenienti solo dal sito nytimes.com.

Le carte descrivono anche un flusso di dati tra le due aziende attraverso iniziative interne chiamate Project Taxi e Project Mango: OpenAI avrebbe consegnato l’intero dataset di addestramento di GPT-3 a Microsoft, che a sua volta avrebbe fornito dati a OpenAI per valutare l’integrazione dei modelli nei propri prodotti commerciali. Il dataset assemblato tramite Project Mango conterrebbe copie di almeno 160.903 opere uniche degli editori coinvolti nella causa.

La causa legale degli editori e il ruolo del giudice Stein

La vicenda giudiziaria nasce da una denuncia depositata da The New York Times a fine 2023 contro Microsoft e OpenAI, causa poi allargata a undici altri editori. Il procedimento, ancora aperto dopo tre anni, ha costretto OpenAI a conservare 20 milioni di log di conversazioni ChatGPT come materiale probatorio.

A seguire il caso presso la Corte distrettuale del Southern District di New York è il giudice Sidney Stein, che sta valutando le richieste di giudizio sommario mentre continuano a essere desecretati nuovi documenti. Vale la pena ricordare che gran parte del materiale reso pubblico proviene dal brief presentato dal New York Times, non dagli allegati sottostanti, ancora sotto sigillo: le citazioni circolate vanno quindi lette senza il loro contesto originale completo.

Sul piano più ampio, la partita si gioca anche sul terreno normativo: già a inizio mese l’amministrazione statunitense aveva depositato un proprio parere a sostegno della posizione di OpenAI sull’uso non licenziato di materiale protetto da copyright per l’addestramento dei modelli linguistici, segno di quanto la questione travalichi il singolo caso giudiziario.

Le difese di Nadella e OpenAI: licenze e fair use

Il CEO di Microsoft Satya Nadella, in una deposizione, ha dichiarato che “qualsiasi cosa protetta da un paywall dovrebbe essere concessa in licenza da chiunque voglia utilizzarla” per l’addestramento o come base informativa dei modelli. Nadella ha aggiunto che, se fosse stato informato del fatto che OpenAI aveva raccolto e addestrato i propri sistemi su contenuti protetti da paywall, avrebbe esercitato il diritto contrattuale di Microsoft di richiedere un nuovo addestramento dei modelli. Un portavoce ha precisato che il CEO “si riferiva a principi generali” sul modo in cui le persone trovano e consumano informazioni.

Sul fronte OpenAI, emergono dichiarazioni interne che complicano la linea difensiva ufficiale. Nick Turley, allora responsabile del team ChatGPT, scriveva nel giugno 2023 che l’intelligenza artificiale rappresentava una “minaccia esistenziale” per gli editori, per poi ribadire nel febbraio 2024 che i prodotti AI “diventeranno sempre più sostitutivi man mano che migliorano”. Un ingegnere OpenAI, in un memo del febbraio 2023, notava inoltre che “non importa quanto in modo prominente mostriamo i link, gli utenti non cliccheranno”, un’osservazione che smonta l’argomento secondo cui i chatbot rimandano traffico verso i siti degli editori.

Ancora più indietro nel tempo, un memo del 2020 firmato dall’allora direttore delle politiche Jack Clark e indirizzato a Brockman e al co-fondatore Sam Altman avvertiva che l’azienda stava “creando sistemi che sostituiscono il lavoro delle persone che definiscono la ‘cultura’ della società”, rischiando di diventare “il simbolo di come la Silicon Valley entra senza pensarci in altre parti della vita lasciando un disordine sul pavimento”. Clark ha poi lasciato OpenAI per co-fondare Anthropic, che di fronte alla richiesta di commento del New York Times ha rimandato la questione a OpenAI stessa.

Nonostante queste ammissioni interne, sia Microsoft che OpenAI continuano a sostenere in sede legale che l’addestramento dei modelli costituisce fair use, trasformando gli articoli in un’opera nuova piuttosto che sostituendo gli originali. È una linea di difesa che finora ha trovato giudici in gran parte favorevoli alle aziende AI, ma che i nuovi documenti rendono più difficile da sostenere senza contraddizioni. Steven Lieberman, legale che rappresenta il New York Daily News e altri sette quotidiani, ha commentato: “il mondo può vedere cosa OpenAI e Microsoft pensassero da sempre riguardo alla correttezza del proprio comportamento”. Il New York Times, parte in causa, ha declinato di commentare la vicenda ai propri stessi giornalisti, che a loro volta segnalano come OpenAI non abbia risposto alle richieste di chiarimento.

FAQ

Quali preoccupazioni legate al lavoro hanno espresso i dipendenti Microsoft sullo scraping dei dati per l’AI?

I dipendenti Microsoft hanno discusso se l’uso di articoli giornalistici da parte di OpenAI costituisse “il più grande furto di lavoro nella storia dell’umanità”, avvertendo anche di possibili effetti negativi sulla qualità dei modelli AI stessi.

Chi ha presentato la causa contro Microsoft e OpenAI, e quando?

The New York Times ha depositato la causa a fine 2023, successivamente affiancata da undici altri editori.

Qual è la posizione del CEO di Microsoft Satya Nadella sull’uso di contenuti a pagamento per l’addestramento dell’AI?

Satya Nadella ha testimoniato che i contenuti protetti da paywall dovrebbero essere concessi in licenza da chiunque intenda utilizzarli per l’addestramento dei modelli.

Come si difende OpenAI riguardo all’uso di materiale protetto da copyright nell’addestramento dell’AI?

OpenAI sostiene che il proprio addestramento rientra nel fair use, trasformando gli articoli in un’opera nuova piuttosto che sostituendo gli originali.

Contenuto realizzato con l’assistenza dell’intelligenza artificiale e con revisione editoriale umana.