Processtukken tonen dat Microsoft en OpenAI intern waarschuwden voor de gevolgen van het scrapen van nieuwscontent, terwijl een lopende zaak de rechtmatigheid ervan toetst, meldt TechCrunch.
Voor een Nederlandse organisatie die Copilot of ChatGPT inzet, verschuift de inzet van een abstracte trainingsvraag naar aantoonbare herkomst van de inhoud die een systeem gebruikt en uitstuurt. Contracten, licenties en filters bepalen wat een leverancier belooft én welk bewijs een klant overhoudt wanneer AI-output herkenbaar op andermans werk lijkt.

Wat er in de stukken staat
De opvallendste passages zijn geen rechterlijke vaststellingen. Ze komen uit een openbare, geredigeerde procesbrief van de nieuwsuitgevers en uit interne documenten die daarin worden aangehaald. De onderliggende stukken blijven grotendeels afgeschermd. De rechtbank heeft dus nog niet vastgesteld dat de beschreven scraping juridisch onrechtmatig is. De Washington Post beschrijft dezelfde onthulling als een op 17 september vrijgegeven procesdocument in de zaak.
De procesbrief verwijst naar een interne Microsoft-presentatie uit januari 2024. Volgens de daarin aangehaalde cijfers verlaagde Copilots antwoordmachine de doorklikratio naar nytimes.com met maximaal 93 procent ten opzichte van traditionele Bing-resultaten. Microsofts directeur Applied Science Brent Hecht noemde dat een "doom loop": AI-antwoorden halen verkeer weg bij de bronnen die de modellen voeden. OpenAI-topman voor ChatGPT Nick Turley schreef intern dat uitgevers een "existential threat" ondervinden van producten die steeds meer een vervanging voor hun werk worden.
De schaal van de kopieën is eveneens concreet. De stukken noemen meer dan 91.692 kopieën van werken van The New York Times, Daily News en het Center for Investigative Reporting in tussendatasets. Een dataset op basis van Common Crawl zou meer dan 2 miljoen documenten van nytimes.com bevatten. In Project Mango zouden minstens 160.903 unieke werken van nieuwsuitgevers zijn verzameld. Dit zijn aantallen uit processtukken en partijstellingen, geen door de rechter vastgestelde overtredingen.
Wat deze fase toevoegt
Eerder lag de procesas bij Microsofts analyse van 8,2 miljoen Copilot-gesprekken, waarin nieuwsartikelen vrijwel nooit opdoken. De nieuwe stukken trekken de lijn terug naar de keten daarvoor: hoe trainingsdata werd verzameld, hoe betaalmuren volgens de procesbrief werden omzeild en hoe interne teams het risico op verdringing van uitgevers beschreven. Ook Satya Nadella verklaarde volgens de stukken dat materiaal achter een betaalmuur voor training of onderbouwing gelicentieerd moet zijn.
De openbare docket voor zaak 1:23-cv-11195 laat zien dat het om lopende procedures over samenvattende vonnissen gaat, niet om een einduitspraak. TechCrunch meldt dat Microsoft en OpenAI niet reageerden op verzoeken om commentaar.
De praktische inzet
De leveranciersvraag wordt daarmee concreter: welke vrijwaring geldt bij herkenbare output, welke filters en tests zijn onderdeel van die belofte, en kan een organisatie de herkomst van gebruikte broninhoud aantonen? Voor contentteams komt daar een tweede laag bij. Een AI-antwoord kan sneller ontstaan dan het bewijs dat de tekst, afbeelding of bron rechtmatig mag worden hergebruikt.
De processtukken veranderen vandaag geen Nederlandse auteursrechtregel. Ze leggen wel bloot dat training, zoekresultaten en gegenereerde tekst voor zakelijke gebruikers één keten vormen. Het leveranciersrisico bestaat uit twee vragen: of een model werkt en of de bron, de licentie en de controle achter het antwoord zijn uit te leggen.
Veelgestelde vragen
AI met bron en controle
Ik ontwerp en bouw AI-processen waarin herkomst, bronverwijzingen en toegangsrechten vanaf het begin kloppen. Van meedenken en ontwerp tot realiseren en automatiseren, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
