wikiHow klaagt OpenAI aan bij de federale rechtbank in Manhattan en betwist in zijn dagvaarding van 21 augustus ook het live ophalen van zijn how-to-artikelen tijdens het beantwoorden van vragen.
Dat tweede verwijt tilt de zaak uit de rij bekende trainingsprocedures. Laat je een AI-assistent zoeken in materiaal van een ander, denk aan handleidingen, normen, branchekennis of gescrapete webpagina's, dan loopt volgens deze redenering ook licentierisico wie nooit een model heeft getraind. De kopie ontstaat dan niet eenmalig in een trainingsset, maar telkens opnieuw op het moment dat het systeem een antwoord onderbouwt.
Wat er op tafel ligt
De zaak draait onder nummer 1:26-cv-07171 bij de rechtbank voor het zuidelijke district van New York. Er zijn negen gedaagden, allemaal OpenAI-vennootschappen die hetzelfde adres in Wilmington, Delaware voeren. Microsoft, medegedaagde in verschillende andere ChatGPT-zaken, staat er deze keer niet bij.
wikiHow beroept zich op 1.211 auteursrechtregistraties die samen 11.211 artikelen dekken. Het zegt auteursrecht te bezitten op meer dan 300.000 artikelen en publiceerde er in totaal ruim 500.000 in tientallen talen, goed voor meer dan 150 miljoen bezoekers per maand op zijn hoogtepunt.
De dagvaarding bevat vier claims. Kopiëren als input voor zowel modeltraining als RAG-systemen. Reproductie van beschermde tekst in de antwoorden die ChatGPT teruggeeft. Aansprakelijkheid van de moeder- en holdingvennootschappen voor die inbreuk. En het verwijderen van copyright management information onder de DMCA, waarbij wikiHow wijst op extractietools als Dragnet en Newspaper die de body-tekst van een pagina losknippen en juist de voettekst met auteur en copyrightvermelding weggooien.

De retrieval-claim is het nieuwe stuk
De eerdere golf procedures ging over de trainingsdata en verder niets. Toen bijna 400 lokale Amerikaanse kranten Microsoft en OpenAI aanklaagden omdat hun journalistiek zonder vergoeding in de trainingssets belandde, stond de vraag centraal of het inlezen van beschermd materiaal geoorloofd is. wikiHow legt daar een tweede laag bovenop.
De dagvaarding citeert OpenAI's eigen documentatie, die RAG omschrijft als een techniek die externe context in de prompt injecteert zodat het model niet alleen op zijn getrainde kennis hoeft te leunen. Precies dat mechanisme is volgens wikiHow een zelfstandige inbreuk: de ophaalsystemen maken bij elk antwoord dat ze onderbouwen een verse kopie van het artikel. Een gebruiker die vraagt hoe hij een klus aanpakt, krijgt dan een antwoord dat op het artikel is gebouwd zonder dat de bron ooit genoemd wordt.
OpenAI heeft nog niet gereageerd. Het docket telt drie stukken, alle drie van 21 augustus: de dagvaarding, het formulier met de zaakgegevens en de verklaring over de vennootschapsstructuur. Het is volgens de telling van juridische tracker ChatGPT Is Eating the World de vierentwintigste auteursrechtzaak tegen OpenAI.
robots.txt hield de crawlers niet tegen
Het feitelijke deel van de dagvaarding is het meest bruikbare voor iedere site-eigenaar. wikiHow blokkeerde GPTBot in augustus 2023 via robots.txt. Toen in januari 2025 bleek dat OpenAI meer crawlers gebruikt, kwamen daar regels bij voor OAI-SearchBot en ChatGPT-User, precies de bots die het zoeken en ophalen tijdens een gesprek verzorgen. Volgens de logs van wikiHow bezochten OpenAI-bots de site tussen 1 mei en 21 juli 2026 alsnog 148.529 keer, en scrapeten OpenAI en Common Crawl de site sinds mei 2025 meer dan 300.000 keer.
Dat is geen exotisch probleem. In Nederland noemt 83 procent van de webshops geen enkele AI-crawler in het robots.txt-bestand, waarmee ze zonder het te weten trainings- en retrieval-materiaal leveren. wikiHow deed het omgekeerde, expliciet en herhaald, en beschrijft in de dagvaarding hoe het vanaf het voorjaar van 2024 met OpenAI over een licentie sprak zonder dat er ooit een serieus bod kwam, terwijl OpenAI in dezelfde periode wel licenties sloot met andere uitgevers.
Wat het raakt bij wie zelf RAG bouwt
De vraag die hier voorligt is niet of RAG mag. Het patroon zelf is onomstreden en werkt uitstekend zolang het je eigen documenten zijn die de assistent doorzoekt, zoals handleidingen, productinformatie of oude supporttickets. De vraag is wiens materiaal er in de index staat en op welke titel het daar terechtkwam.
Drie dingen worden daarmee concreet voor een organisatie die een assistent op externe bronnen laat zoeken: waar de opgehaalde documenten vandaan komen, wat de gebruiksvoorwaarden van die bronnen zeggen, en of het ophalen langs een robots.txt-verbod gaat. Die administratie was tot nu toe iets voor wie modellen traint. Als de rechter meegaat in wikiHow's redenering, wordt het iets voor wie alleen maar zoekt.
Europees gezien sluit dat aan op een lijn die al zichtbaar werd toen het Landgericht München I de datamining-uitzondering te smal vond voor verveelvoudigingen die blijvend in het model achterblijven. Die uitzondering komt uit dezelfde Europese richtlijn als artikel 15o van de Auteurswet, dat commerciële tekst- en datamining toestaat zolang de rechthebbende geen voorbehoud maakte. Bij retrieval is de kopie nog directer: hij ontstaat op het moment van het antwoord, uit een bron die je op dat moment aanwijst. Waar het juridische gevecht tot nu toe over de bouwfase van AI ging, verschuift het met deze zaak naar de gebruiksfase, en dat is de fase waarin bedrijven zelf aan de knoppen zitten.
Veelgestelde vragen
AI die zoekt in jouw kennis
Een assistent die antwoord geeft uit je eigen handleidingen, contracten en tickets vraagt om een index waarvan je precies weet wat erin zit. Ik denk mee over de opzet, ontwerp de bronstructuur en bouw het geheel, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
