Nederlandse webshops maken massaal geen keuze over AI-crawlers: 74 van de 89 onderzochte shops noemen GPTBot, ClaudeBot of PerplexityBot nergens in hun robots.txt, blijkt uit eigen onderzoek van hostingbedrijf Surver, gepubliceerd op Emerce.
Dat bestand van een paar regels bepaalt of je productpagina's mogen opduiken in de antwoorden van ChatGPT, Perplexity en Google AI Mode, en of je catalogus meegaat in de training van die modellen. Staat er niets over AI-bots in, dan beslist niet de shopeigenaar maar de standaardinstelling van zijn hosting, thema of securityplugin. Voor een webshop die klanten steeds vaker via een AI-antwoord binnenhaalt, wordt een commerciële keuze zo per ongeluk gemaakt.
Hoe het onderzoek is opgezet
Surver analyseerde de robots.txt van 100 Nederlandse webshops: de 40 grootste retailketens van het land plus 60 WooCommerce-shops uit de eigen klantenportefeuille. Elf shops hielden hun robots.txt zelf achter een botmuur, waardoor 89 bestanden overbleven om te lezen. In 74 daarvan kwam geen van de onderzochte crawlers voor: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, CCBot, Amazonbot en Google-Extended.
Het verschil tussen groot en klein is kleiner dan je zou verwachten. Bij de grote ketens had 86 procent geen AI-regel, bij de mkb-shops 81 procent. Twee kanttekeningen horen erbij. De 60 mkb-shops komen uit de eigen klantenportefeuille van het onderzoekende bedrijf, dus dat deel van de steekproef is niet willekeurig getrokken. En robots.txt is een verzoek, geen slot: wie AI-bots op CDN- of firewallniveau weert, valt hier buiten beeld. Het onderzoek gaat er zelf van uit dat het werkelijke aandeel shops met een bewuste keuze nog lager ligt dan de 17 procent die überhaupt iets over AI-bots in het bestand had staan.
Twee ketens kozen wel, en kozen tegengesteld
Van de 89 shops waren er precies twee met beleid dat als een bewuste beslissing te herkennen is. Woonwinkel Flinders zet de deur op slot en geeft GPTBot, ClaudeBot, CCBot, Amazonbot, Google-Extended en Applebot-Extended allemaal een Disallow. Het bestand gaat verder dan blokkeren alleen: aan de overige crawlers geeft het een Content-Signal mee met search=yes, ai-train=no, use=reference. Zoeken mag, trainen niet, citeren met bronvermelding wel.
MediaMarkt doet vrijwel het omgekeerde en splitst per partij. OAI-SearchBot, GPTBot, PerplexityBot en ClaudeBot mogen binnen, terwijl CCBot van Common Crawl en Amazonbot buiten blijven. Dat is geen alles-of-niets: de bots van de partijen die daadwerkelijk antwoorden tonen aan klanten krijgen toegang, de bots die vooral datasets voor derden aanleggen niet.
Die fijnregeling kan omdat aanbieders hun crawlers uit elkaar trekken. OpenAI documenteert vier bots met elk een eigen taak: OAI-SearchBot voor de zoekresultaten in ChatGPT, GPTBot voor trainingsdata, ChatGPT-User voor pagina's die iemand tijdens een gesprek laat ophalen en OAI-AdsBot voor advertentiecontrole. Blokkeer je die in één moeite, dan houd je je producten ook buiten de antwoorden, terwijl je ze afzonderlijk kunt toestaan of weren zonder je gewone Google-vindbaarheid te raken.
Geen regel is ook een keuze
Het onderzoek laat zien hoe die stilte ontstaat. Zeven mkb-shops bleken een identieke robots.txt te hebben, compleet met crawl-delay-instructies: niet hun eigen beslissing, maar de standaard van hun serveromgeving. Vier andere shops blokkeerden AI-crawlers juist volledig, niet uit strategie maar via de preset van een securityplugin. Die vier zijn onzichtbaar in AI-antwoorden zonder dat iemand daar ooit voor koos.
De defaults gaan bovendien schuiven. Cloudflare blokkeert vanaf 15 september 2026 trainings- en agent-crawlers standaard op advertentiepagina's van nieuwe domeinen, terwijl bestaande klanten tot die datum zelf kunnen bepalen of ze meegaan. Wie niets instelt, erft straks de keuze van zijn leverancier.
Controleren kost een minuut: zet /robots.txt achter je domeinnaam en kijk of GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot en Google-Extended erin voorkomen. Staat er niets over deze bots, dan is er niets besloten. Herhaal het per subdomein, want een regel op www geldt niet voor shop. of blog.. Toegang geven is ook de vierde stap van een AEO-aanpak, want zonder toegang kun je simpelweg nooit geciteerd worden.
De afweging zelf is niet technisch maar commercieel. Wie zijn productdata afschermt, houdt de catalogus uit gratis hergebruik en verdwijnt tegelijk uit het antwoord waarin een klant zijn keuze maakt. Wie ze openzet, betaalt met zijn assortiment voor een plek in dat antwoord. Het is dezelfde rekensom als bij productdata in schema.org en een machineleesbare productfeed, die bepalen of een AI-agent je shop überhaupt kan lezen: al dat werk telt pas mee als de bot binnen mag. Dat 83 procent van de onderzochte shops die rekensom nog nooit heeft gemaakt, zegt vooral iets over hoe snel AI-zoeken van experiment naar verkoopkanaal is opgeschoven.
Veelgestelde vragen
Bewust kiezen wat AI leest
Of een AI je producten kan lezen is geen plugin-instelling maar een keuze over je data en je vindbaarheid. Ik denk daarin mee, ontwerp de aanpak en richt hem ook echt in, van je robots.txt en productdata tot de koppelingen eronder, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
