Papieren formulieren, een pen en een smartphone op een tafel
Nieuws18 september · 03:024 min leestijd

Processtukken tonen interne zorgen over AI-scraping bij Microsoft en OpenAI

Nieuwe processtukken in de zaak van The New York Times tegen Microsoft en OpenAI leggen interne zorgen over AI-scraping bloot. Voor Nederlandse gebruikers verschuift de inzet naar contentherkomst, licenties en controleerbare AI-output.

Processtukken tonen dat Microsoft en OpenAI intern waarschuwden voor de gevolgen van het scrapen van nieuwscontent, terwijl een lopende zaak de rechtmatigheid ervan toetst, meldt TechCrunch.

Voor een Nederlandse organisatie die Copilot of ChatGPT inzet, verschuift de inzet van een abstracte trainingsvraag naar aantoonbare herkomst van de inhoud die een systeem gebruikt en uitstuurt. Contracten, licenties en filters bepalen wat een leverancier belooft én welk bewijs een klant overhoudt wanneer AI-output herkenbaar op andermans werk lijkt.

OpenAI-logo op een sticker in een hand, illustratie van de AI-leverancier, bron: FoxTPNL / Wikimedia Commons (CC BY 4.0)
OpenAI-logo op een sticker in een hand, illustratie van de AI-leverancier, bron: FoxTPNL / Wikimedia Commons (CC BY 4.0)

Wat er in de stukken staat

De opvallendste passages zijn geen rechterlijke vaststellingen. Ze komen uit een openbare, geredigeerde procesbrief van de nieuwsuitgevers en uit interne documenten die daarin worden aangehaald. De onderliggende stukken blijven grotendeels afgeschermd. De rechtbank heeft dus nog niet vastgesteld dat de beschreven scraping juridisch onrechtmatig is. De Washington Post beschrijft dezelfde onthulling als een op 17 september vrijgegeven procesdocument in de zaak.

De procesbrief verwijst naar een interne Microsoft-presentatie uit januari 2024. Volgens de daarin aangehaalde cijfers verlaagde Copilots antwoordmachine de doorklikratio naar nytimes.com met maximaal 93 procent ten opzichte van traditionele Bing-resultaten. Microsofts directeur Applied Science Brent Hecht noemde dat een "doom loop": AI-antwoorden halen verkeer weg bij de bronnen die de modellen voeden. OpenAI-topman voor ChatGPT Nick Turley schreef intern dat uitgevers een "existential threat" ondervinden van producten die steeds meer een vervanging voor hun werk worden.

De schaal van de kopieën is eveneens concreet. De stukken noemen meer dan 91.692 kopieën van werken van The New York Times, Daily News en het Center for Investigative Reporting in tussendatasets. Een dataset op basis van Common Crawl zou meer dan 2 miljoen documenten van nytimes.com bevatten. In Project Mango zouden minstens 160.903 unieke werken van nieuwsuitgevers zijn verzameld. Dit zijn aantallen uit processtukken en partijstellingen, geen door de rechter vastgestelde overtredingen.

Wat deze fase toevoegt

Eerder lag de procesas bij Microsofts analyse van 8,2 miljoen Copilot-gesprekken, waarin nieuwsartikelen vrijwel nooit opdoken. De nieuwe stukken trekken de lijn terug naar de keten daarvoor: hoe trainingsdata werd verzameld, hoe betaalmuren volgens de procesbrief werden omzeild en hoe interne teams het risico op verdringing van uitgevers beschreven. Ook Satya Nadella verklaarde volgens de stukken dat materiaal achter een betaalmuur voor training of onderbouwing gelicentieerd moet zijn.

De openbare docket voor zaak 1:23-cv-11195 laat zien dat het om lopende procedures over samenvattende vonnissen gaat, niet om een einduitspraak. TechCrunch meldt dat Microsoft en OpenAI niet reageerden op verzoeken om commentaar.

De praktische inzet

De leveranciersvraag wordt daarmee concreter: welke vrijwaring geldt bij herkenbare output, welke filters en tests zijn onderdeel van die belofte, en kan een organisatie de herkomst van gebruikte broninhoud aantonen? Voor contentteams komt daar een tweede laag bij. Een AI-antwoord kan sneller ontstaan dan het bewijs dat de tekst, afbeelding of bron rechtmatig mag worden hergebruikt.

De processtukken veranderen vandaag geen Nederlandse auteursrechtregel. Ze leggen wel bloot dat training, zoekresultaten en gegenereerde tekst voor zakelijke gebruikers één keten vormen. Het leveranciersrisico bestaat uit twee vragen: of een model werkt en of de bron, de licentie en de controle achter het antwoord zijn uit te leggen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI met bron en controle

Ik ontwerp en bouw AI-processen waarin herkomst, bronverwijzingen en toegangsrechten vanaf het begin kloppen. Van meedenken en ontwerp tot realiseren en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft verlegt auteursrechtzaak naar hoe vaak Copilot beschermde tekst teruggeeft
Nieuws
6 min

5 sep 02:10

Microsoft verlegt auteursrechtzaak naar hoe vaak Copilot beschermde tekst teruggeeft

Microsoft vraagt de rechter in Manhattan de auteursrechtzaak van The New York Times zonder proces te beslissen, met 8,2 miljoen Copilot-gesprekken als bewijs dat nieuwsteksten er vrijwel nooit uit komen.

Seattle Times en Newsday eisen vernietiging van AI-modellen met hun artikelen
Nieuws
5 min

5 sep 08:08

Seattle Times en Newsday eisen vernietiging van AI-modellen met hun artikelen

The Seattle Times en Newsday eisen in een dagvaarding van 4 september de vernietiging van alle AI-modellen en trainingsdatasets met hun artikelen. Die eis raakt niet je rekening, maar de beschikbaarheid van ChatGPT en Copilot.

Uitgevers eisen sancties tegen OpenAI om verborgen ChatGPT-bewijs
Nieuws
4

9 jul 22:09

Uitgevers eisen sancties tegen OpenAI om verborgen ChatGPT-bewijs

Amerikaanse uitgevers onder leiding van The New York Times vragen een rechter om sancties tegen OpenAI, dat volgens hen ChatGPT-logs verborg en wiste en jarenlang loog over de vraag of het zijn trainingsdata kon doorzoeken.

Microsoft boekt 3,2 miljard op Anthropic, 480 miljoen op OpenAI
Nieuws
4 min

30 jul 02:14

Microsoft boekt 3,2 miljard op Anthropic, 480 miljoen op OpenAI

Microsoft boekte 3,2 miljard dollar winst op zijn Anthropic-belang en 480 miljoen op OpenAI in hetzelfde kwartaal. Azure ging over de 100 miljard omzet. Wat dat betekent voor je AI-leverancierskeuze.

AVG-checklist voor generatieve AI: zo zet je ChatGPT en Copilot rechtmatig in
Gids
Uitgebreide gids9 min

14 jul 14:47

AVG-checklist voor generatieve AI: zo zet je ChatGPT en Copilot rechtmatig in

Je gebruikt ChatGPT of Copilot, maar legde nergens vast op welke grondslag. Deze checklist loodst je langs de AVG voor generatieve AI: van de eerste vraag tot grondslag, verwerkersovereenkomst, DPIA en de waarborgen die de AP eist.

Microsoft steekt 2,5 miljard in 'Frontier Company' die AI-engineers ín je bedrijf plaatst
Nieuws
6 min

2 jul 16:10

Microsoft steekt 2,5 miljard in 'Frontier Company' die AI-engineers ín je bedrijf plaatst

Microsoft lanceert The Microsoft Frontier Company: 2,5 miljard dollar en 6.000 mensen die AI-systemen bij klanten bouwen en draaien. Twee dagen na AWS' vergelijkbare stap wordt de uitrol van AI het nieuwe slagveld.