Papieren formulieren, een pen en een smartphone op een tafel
Nieuws18 september · 03:024 min leestijd

Processtukken tonen interne zorgen over AI-scraping bij Microsoft en OpenAI

Nieuwe processtukken in de zaak van The New York Times tegen Microsoft en OpenAI leggen interne zorgen over AI-scraping bloot. Voor Nederlandse gebruikers verschuift de inzet naar contentherkomst, licenties en controleerbare AI-output.

Processtukken tonen dat Microsoft en OpenAI intern waarschuwden voor de gevolgen van het scrapen van nieuwscontent, terwijl een lopende zaak de rechtmatigheid ervan toetst, meldt TechCrunch.

Voor een Nederlandse organisatie die Copilot of ChatGPT inzet, verschuift de inzet van een abstracte trainingsvraag naar aantoonbare herkomst van de inhoud die een systeem gebruikt en uitstuurt. Contracten, licenties en filters bepalen wat een leverancier belooft én welk bewijs een klant overhoudt wanneer AI-output herkenbaar op andermans werk lijkt.

OpenAI-logo op een sticker in een hand, illustratie van de AI-leverancier, bron: FoxTPNL / Wikimedia Commons (CC BY 4.0)
OpenAI-logo op een sticker in een hand, illustratie van de AI-leverancier, bron: FoxTPNL / Wikimedia Commons (CC BY 4.0)

Wat er in de stukken staat

De opvallendste passages zijn geen rechterlijke vaststellingen. Ze komen uit een openbare, geredigeerde procesbrief van de nieuwsuitgevers en uit interne documenten die daarin worden aangehaald. De onderliggende stukken blijven grotendeels afgeschermd. De rechtbank heeft dus nog niet vastgesteld dat de beschreven scraping juridisch onrechtmatig is. De Washington Post beschrijft dezelfde onthulling als een op 17 september vrijgegeven procesdocument in de zaak.

De procesbrief verwijst naar een interne Microsoft-presentatie uit januari 2024. Volgens de daarin aangehaalde cijfers verlaagde Copilots antwoordmachine de doorklikratio naar nytimes.com met maximaal 93 procent ten opzichte van traditionele Bing-resultaten. Microsofts directeur Applied Science Brent Hecht noemde dat een "doom loop": AI-antwoorden halen verkeer weg bij de bronnen die de modellen voeden. OpenAI-topman voor ChatGPT Nick Turley schreef intern dat uitgevers een "existential threat" ondervinden van producten die steeds meer een vervanging voor hun werk worden.

De schaal van de kopieën is eveneens concreet. De stukken noemen meer dan 91.692 kopieën van werken van The New York Times, Daily News en het Center for Investigative Reporting in tussendatasets. Een dataset op basis van Common Crawl zou meer dan 2 miljoen documenten van nytimes.com bevatten. In Project Mango zouden minstens 160.903 unieke werken van nieuwsuitgevers zijn verzameld. Dit zijn aantallen uit processtukken en partijstellingen, geen door de rechter vastgestelde overtredingen.

Wat deze fase toevoegt

Eerder lag de procesas bij Microsofts analyse van 8,2 miljoen Copilot-gesprekken, waarin nieuwsartikelen vrijwel nooit opdoken. De nieuwe stukken trekken de lijn terug naar de keten daarvoor: hoe trainingsdata werd verzameld, hoe betaalmuren volgens de procesbrief werden omzeild en hoe interne teams het risico op verdringing van uitgevers beschreven. Ook Satya Nadella verklaarde volgens de stukken dat materiaal achter een betaalmuur voor training of onderbouwing gelicentieerd moet zijn.

De openbare docket voor zaak 1:23-cv-11195 laat zien dat het om lopende procedures over samenvattende vonnissen gaat, niet om een einduitspraak. TechCrunch meldt dat Microsoft en OpenAI niet reageerden op verzoeken om commentaar.

De praktische inzet

De leveranciersvraag wordt daarmee concreter: welke vrijwaring geldt bij herkenbare output, welke filters en tests zijn onderdeel van die belofte, en kan een organisatie de herkomst van gebruikte broninhoud aantonen? Voor contentteams komt daar een tweede laag bij. Een AI-antwoord kan sneller ontstaan dan het bewijs dat de tekst, afbeelding of bron rechtmatig mag worden hergebruikt.

De processtukken veranderen vandaag geen Nederlandse auteursrechtregel. Ze leggen wel bloot dat training, zoekresultaten en gegenereerde tekst voor zakelijke gebruikers één keten vormen. Het leveranciersrisico bestaat uit twee vragen: of een model werkt en of de bron, de licentie en de controle achter het antwoord zijn uit te leggen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI met bron en controle

Ik ontwerp en bouw AI-processen waarin herkomst, bronverwijzingen en toegangsrechten vanaf het begin kloppen. Van meedenken en ontwerp tot realiseren en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Causaly brengt geciteerde research naar Microsoft Copilot
Nieuws
4 min

17 sep 22:48

Causaly brengt geciteerde research naar Microsoft Copilot

Causaly maakt zijn gespecialiseerde onderzoeksagent beschikbaar in Microsoft Copilot. Farmaceutische en biotechteams kunnen vanuit Microsoft 365 biomedische vragen uitwerken met verwijzingen naar literatuur, databanken en kennisgrafen.

Microsoft telt 15 keer meer actieve agents in Microsoft 365
Nieuws
4 min

17 sep 18:45

Microsoft telt 15 keer meer actieve agents in Microsoft 365

Microsofts eigen telemetrie laat zien hoe agents van productiviteitstaken naar bedrijfsprocessen bewegen. Voor Nederlandse organisaties worden adoptie, toezicht, evaluatie en budgettering per taak daardoor relevant.

Microsoft legt AI-voorsprong bij eigen data en evaluaties
Nieuws
4 min

17 sep 18:20

Microsoft legt AI-voorsprong bij eigen data en evaluaties

Microsoft bundelt honderden eigen AI-trajecten in een Frontier Playbook. De les: bedrijfsdata, evaluaties en feedbacklussen vormen de blijvende voorsprong, terwijl het onderliggende model verwisselbaar blijft.

OpenAI publiceert raamwerk voor meldingen van modelmisalignment
Nieuws
5 min

17 sep 02:17

OpenAI publiceert raamwerk voor meldingen van modelmisalignment

OpenAI publiceert zes meldingen van onverwacht modelgedrag en beschrijft wanneer zulke gevallen voortaan worden onderzocht en gedeeld. Voor Nederlandse afnemers worden rapportvelden, uitzonderingen en de grenzen van klantinformatie concreet.

Databricks investeert ruim 350 miljoen dollar in Singapore
Nieuws
4 min

16 sep 08:44

Databricks investeert ruim 350 miljoen dollar in Singapore

Databricks investeert meer dan 350 miljoen dollar in Singapore en bouwt er zijn enterprise-AI-ecosysteem uit. Voor Nederlandse datateams is vooral de koppeling van agentcontext, governance, modelkeuze en kostencontrole relevant.

OpenAI steunt federale AI-toetsing in FRONTIER Act
Nieuws
4 min

15 sep 20:46

OpenAI steunt federale AI-toetsing in FRONTIER Act

OpenAI steunt voor het eerst een federale plicht voor onafhankelijke veiligheidstoetsen van frontier-AI. H.R. 9925 richt die toetsingsplicht op de grootste ontwikkelaars, met mogelijke gevolgen voor releasevoorwaarden en Europese AI-inkoop.