Rij hoge zuilen langs de gevel van een klassiek gerechtsgebouw
Nieuws24 augustus · 22:135 min leestijd

wikiHow klaagt OpenAI aan om training en RAG-ophalen van zijn artikelen

wikiHow sleept negen OpenAI-entiteiten voor de rechter in Manhattan en betwist naast de AI-training ook het live ophalen van zijn how-to-artikelen bij elk antwoord. Die retrieval-claim raakt iedereen die AI op andermans content laat zoeken.

wikiHow klaagt OpenAI aan bij de federale rechtbank in Manhattan en betwist in zijn dagvaarding van 21 augustus ook het live ophalen van zijn how-to-artikelen tijdens het beantwoorden van vragen.

Dat tweede verwijt tilt de zaak uit de rij bekende trainingsprocedures. Laat je een AI-assistent zoeken in materiaal van een ander, denk aan handleidingen, normen, branchekennis of gescrapete webpagina's, dan loopt volgens deze redenering ook licentierisico wie nooit een model heeft getraind. De kopie ontstaat dan niet eenmalig in een trainingsset, maar telkens opnieuw op het moment dat het systeem een antwoord onderbouwt.

Wat er op tafel ligt

De zaak draait onder nummer 1:26-cv-07171 bij de rechtbank voor het zuidelijke district van New York. Er zijn negen gedaagden, allemaal OpenAI-vennootschappen die hetzelfde adres in Wilmington, Delaware voeren. Microsoft, medegedaagde in verschillende andere ChatGPT-zaken, staat er deze keer niet bij.

wikiHow beroept zich op 1.211 auteursrechtregistraties die samen 11.211 artikelen dekken. Het zegt auteursrecht te bezitten op meer dan 300.000 artikelen en publiceerde er in totaal ruim 500.000 in tientallen talen, goed voor meer dan 150 miljoen bezoekers per maand op zijn hoogtepunt.

De dagvaarding bevat vier claims. Kopiëren als input voor zowel modeltraining als RAG-systemen. Reproductie van beschermde tekst in de antwoorden die ChatGPT teruggeeft. Aansprakelijkheid van de moeder- en holdingvennootschappen voor die inbreuk. En het verwijderen van copyright management information onder de DMCA, waarbij wikiHow wijst op extractietools als Dragnet en Newspaper die de body-tekst van een pagina losknippen en juist de voettekst met auteur en copyrightvermelding weggooien.

De ingang van het Daniel Patrick Moynihan United States Courthouse in Manhattan, zetel van de federale rechtbank voor het zuidelijke district van New York. Bron: Ken Lund from Reno, Nevada, USA / Wikimedia Commons (CC BY-SA 2.0)
De ingang van het Daniel Patrick Moynihan United States Courthouse in Manhattan, zetel van de federale rechtbank voor het zuidelijke district van New York. Bron: Ken Lund from Reno, Nevada, USA / Wikimedia Commons (CC BY-SA 2.0)

De retrieval-claim is het nieuwe stuk

De eerdere golf procedures ging over de trainingsdata en verder niets. Toen bijna 400 lokale Amerikaanse kranten Microsoft en OpenAI aanklaagden omdat hun journalistiek zonder vergoeding in de trainingssets belandde, stond de vraag centraal of het inlezen van beschermd materiaal geoorloofd is. wikiHow legt daar een tweede laag bovenop.

De dagvaarding citeert OpenAI's eigen documentatie, die RAG omschrijft als een techniek die externe context in de prompt injecteert zodat het model niet alleen op zijn getrainde kennis hoeft te leunen. Precies dat mechanisme is volgens wikiHow een zelfstandige inbreuk: de ophaalsystemen maken bij elk antwoord dat ze onderbouwen een verse kopie van het artikel. Een gebruiker die vraagt hoe hij een klus aanpakt, krijgt dan een antwoord dat op het artikel is gebouwd zonder dat de bron ooit genoemd wordt.

OpenAI heeft nog niet gereageerd. Het docket telt drie stukken, alle drie van 21 augustus: de dagvaarding, het formulier met de zaakgegevens en de verklaring over de vennootschapsstructuur. Het is volgens de telling van juridische tracker ChatGPT Is Eating the World de vierentwintigste auteursrechtzaak tegen OpenAI.

robots.txt hield de crawlers niet tegen

Het feitelijke deel van de dagvaarding is het meest bruikbare voor iedere site-eigenaar. wikiHow blokkeerde GPTBot in augustus 2023 via robots.txt. Toen in januari 2025 bleek dat OpenAI meer crawlers gebruikt, kwamen daar regels bij voor OAI-SearchBot en ChatGPT-User, precies de bots die het zoeken en ophalen tijdens een gesprek verzorgen. Volgens de logs van wikiHow bezochten OpenAI-bots de site tussen 1 mei en 21 juli 2026 alsnog 148.529 keer, en scrapeten OpenAI en Common Crawl de site sinds mei 2025 meer dan 300.000 keer.

Dat is geen exotisch probleem. In Nederland noemt 83 procent van de webshops geen enkele AI-crawler in het robots.txt-bestand, waarmee ze zonder het te weten trainings- en retrieval-materiaal leveren. wikiHow deed het omgekeerde, expliciet en herhaald, en beschrijft in de dagvaarding hoe het vanaf het voorjaar van 2024 met OpenAI over een licentie sprak zonder dat er ooit een serieus bod kwam, terwijl OpenAI in dezelfde periode wel licenties sloot met andere uitgevers.

Wat het raakt bij wie zelf RAG bouwt

De vraag die hier voorligt is niet of RAG mag. Het patroon zelf is onomstreden en werkt uitstekend zolang het je eigen documenten zijn die de assistent doorzoekt, zoals handleidingen, productinformatie of oude supporttickets. De vraag is wiens materiaal er in de index staat en op welke titel het daar terechtkwam.

Drie dingen worden daarmee concreet voor een organisatie die een assistent op externe bronnen laat zoeken: waar de opgehaalde documenten vandaan komen, wat de gebruiksvoorwaarden van die bronnen zeggen, en of het ophalen langs een robots.txt-verbod gaat. Die administratie was tot nu toe iets voor wie modellen traint. Als de rechter meegaat in wikiHow's redenering, wordt het iets voor wie alleen maar zoekt.

Europees gezien sluit dat aan op een lijn die al zichtbaar werd toen het Landgericht München I de datamining-uitzondering te smal vond voor verveelvoudigingen die blijvend in het model achterblijven. Die uitzondering komt uit dezelfde Europese richtlijn als artikel 15o van de Auteurswet, dat commerciële tekst- en datamining toestaat zolang de rechthebbende geen voorbehoud maakte. Bij retrieval is de kopie nog directer: hij ontstaat op het moment van het antwoord, uit een bron die je op dat moment aanwijst. Waar het juridische gevecht tot nu toe over de bouwfase van AI ging, verschuift het met deze zaak naar de gebruiksfase, en dat is de fase waarin bedrijven zelf aan de knoppen zitten.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI die zoekt in jouw kennis

Een assistent die antwoord geeft uit je eigen handleidingen, contracten en tickets vraagt om een index waarvan je precies weet wat erin zit. Ik denk mee over de opzet, ontwerp de bronstructuur en bouw het geheel, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Duitse rechter wijst fair use af en veroordeelt AI-muziekgenerator Suno
Nieuws
5 min

1 aug 14:11

Duitse rechter wijst fair use af en veroordeelt AI-muziekgenerator Suno

Het Landgericht München I veroordeelt AI-muziekgenerator Suno en wijst zowel de Europese datamining-uitzondering als de Amerikaanse fair use-verdediging af. De rechter stelt vast dat zes nummers reproduceerbaar in het model zijn opgeslagen.

83 procent van Nederlandse webshops noemt geen enkele AI-crawler in robots.txt
Nieuws
4 min

28 jul 08:12

83 procent van Nederlandse webshops noemt geen enkele AI-crawler in robots.txt

Onderzoek naar de robots.txt van 100 Nederlandse webshops laat zien dat 74 van de 89 leesbare bestanden geen enkele AI-crawler noemt. Daarmee beslist de standaardinstelling van hosting of plugin wie je productpagina's mag lezen.

AI-crawlers toelaten of blokkeren: een keuzegids voor je robots.txt en Cloudflare-instellingen
Gids
9 min

2 jul 09:00

AI-crawlers toelaten of blokkeren: een keuzegids voor je robots.txt en Cloudflare-instellingen

Geef je GPTBot, ClaudeBot en soortgenoten toegang of hou je ze buiten? Een stappenplan om per crawler te beslissen, het correct in te stellen en de impact te meten.

GitHub meldt zware storing in API, Actions, Pull Requests en Copilot
Nieuws
4

17 aug 18:08

GitHub meldt zware storing in API, Actions, Pull Requests en Copilot

GitHub zet API Requests, Issues, Pull Requests, Actions en Copilot op major outage. Het incident loopt sinds 15.40 uur zonder bekende oorzaak, met 20 procent fouten op het web en 50 procent op downloads.

15 procent van de AI-fetchers in Europa haalt geblokkeerde pagina's op
Nieuws
6 min

15 aug 16:08

15 procent van de AI-fetchers in Europa haalt geblokkeerde pagina's op

Ongeveer 15 procent van de herkende AI-fetchers in Europa haalde pagina's op die sites in robots.txt hadden verboden, meet TollBit. Drie bots kwamen op bijna de helft van de sites die hen noemden alsnog binnen.

ChatGPT legt kliks en toetsaanslagen vast in onversleutelde bestanden op je Mac
Nieuws
4 min

14 aug 20:22

ChatGPT legt kliks en toetsaanslagen vast in onversleutelde bestanden op je Mac

OpenAI brengt Computer History uit in de ChatGPT-app voor macOS. Kliks, toetsaanslagen en app-wissels worden onversleutelde Markdown-bestanden op de Mac zelf. De toegang in de EER volgt volgens OpenAI binnen enkele weken.