Ongeveer 15 procent van de herkende AI-fetchers in Europa haalde pagina's op die de site in robots.txt had verboden, meet contentplatform TollBit in zijn halfjaarrapport State of the Bots over de eerste helft van 2026.
Het gaat om een specifieke soort bot. Niet de trainingscrawler die het web afgraast voor modeldata, en niet de zoekcrawler die pagina's indexeert, maar de fetcher die één losse pagina ophaalt op het moment dat iemand een vraag typt in ChatGPT of Perplexity. Voor wie in Nederland een site of webshop beheert, verschuift daarmee de vraag van "staat er iets over AI-bots in mijn robots.txt" naar "draait die blokkade ook op een laag die hem kan afdwingen". Die vraag heeft een datum. Op 15 september, precies een maand na vandaag, zet Cloudflare zijn standaardinstellingen om.
Drie fetchers komen op bijna de helft van de sites langs de disallow
De 15 procent is een gemiddelde over een scheve verdeling. ChatGPT-User van OpenAI, Bytespider van ByteDance en Youbot bereikten verboden pagina's op bijna de helft van de Europese sites die hen met naam en toenaam in robots.txt hadden staan. ChatGPT-User raakte daarvan de meeste sites en is tegelijk de fetcher die het vaakst met naam wordt geblokkeerd. Dat is geen tegenspraak maar rekenkunde: de bot die het vaakst wordt aangesproken, is ook de bot die het vaakst betrapt kan worden.
TollBit telt elk verzoek aan een verboden URL als een overtreding, ongeacht wat de documentatie van de aanbieder over de eigen naleving zegt. De maatstaf meet dus wat er in de serverlogs staat, niet wat er is toegezegd.
Europa schrijft de nieuwe fetchers veel minder vaak op
Dezelfde meting laat zien hoe weinig Europese sites die bots überhaupt benoemen. Claude-User van Anthropic staat op 9 procent van de Europese sites in een disallow-regel, tegen 26 procent in Noord-Amerika. Perplexity-User komt uit op 13 tegen 26 procent. De meeste nieuwere fetchers blijven in Europa in de enkele cijfers steken.
Daar hoort een kanttekening bij die het rapport zelf maakt. Een laag aantal geconstateerde overtredingen bewijst geen net gedrag, maar kan simpelweg betekenen dat vrijwel niemand die bot ooit heeft benoemd. Een regel die nooit is geschreven, valt ook niet te overtreden.
Het Nederlandse beeld sluit daarop aan. Eerder onderzoek naar honderd webshops vond dat 74 van de 89 leesbare robots.txt-bestanden geen enkele AI-crawler noemen, en dat een deel van de shops die wel iets hadden ingesteld dat onbedoeld deed via de standaard van hun server of securityplugin.
OpenAI en Anthropic zijn het openlijk oneens
Waarom een disallow-regel voor ChatGPT-User minder gewicht heeft dan een sitebeheerder aanneemt, staat in OpenAI's eigen documentatie. ChatGPT-User bezoekt een pagina wanneer een gebruiker een vraag stelt, en omdat die actie door een gebruiker wordt gestart, gelden robots.txt-regels mogelijk niet, schrijft het bedrijf erbij. Perplexity neemt hetzelfde standpunt in voor Perplexity-User.
Anthropic doet dat niet. Het bedrijf documenteert drie bots, ClaudeBot voor training, Claude-User voor pagina's die iemand tijdens een gesprek laat ophalen en Claude-SearchBot voor de zoekindex, en stelt dat alle drie de standaardrichtlijnen in robots.txt respecteren. Hetzelfde bestand, hetzelfde soort verkeer, twee onverenigbare posities over de vraag of het bestand geldt.
Europese sites krijgen meer verkeer en minder terug
Het bredere beeld in het rapport is dat Europese uitgevers er op elk front slechter uit komen. TollBit meet dat de mediane Europese site vier keer zoveel AI-scrapes krijgt als een Noord-Amerikaanse, en dat de robots.txt-instructies van die site 2,8 keer zo vaak worden genegeerd. Het aantal scrapes op Europese sites lag in juni bijna 20 procent hoger dan in januari 2026.
Wat er tegenover staat is minimaal. Een Europese uitgever heeft 179 AI-botbezoeken nodig voor één doorverwezen menselijke bezoeker, ruim drie keer zo slecht als in Noord-Amerika, en die verhouding verslechterde binnen het halfjaar van 150 op 1 in het eerste kwartaal naar 227 op 1 in het tweede. AI-apps waren goed voor 0,05 procent van alle menselijke verwijzingen naar Europese sites. Cloudflare kwam eerder op dezelfde orde van grootte uit en mat bij grote AI-crawlers tussen de 118 en bijna 50.000 crawls per doorverwezen bezoeker.
De analyse beslaat 3.906 uitgevers, waarvan 456 Europese, met titels als The Telegraph, Ringier en Styria. TollBit-medeoprichter Olivia Joslin wijst als mogelijke verklaring op taal: Europa kent meer talen dan Noord-Amerika, en modellen die al die talen willen leren halen hun materiaal uit navenant meer bronnen.
Alle cijfers gaan bovendien alleen over bots die zichzelf bekendmaken. TollBit tekent daarbij aan dat scrapers zich voordoen als andere user agents, IP-adressen wisselen en via residentiële proxy's binnenkomen, waardoor de werkelijke omvang hoger ligt dan het rapport laat zien. In een voorbeeld uit de eigen audit van het bedrijf probeert een scraper eerst als Googlebot binnen te komen, wordt geweigerd, en haalt de pagina binnen drie seconden als Chrome alsnog op.
De omslag van 15 september
Cloudflare deelt botverkeer sinds 1 juli op in Search, Agent en Training, en blokkeert vanaf 15 september 2026 de categorieën Agent en Training standaard op advertentiepagina's van nieuwe domeinen. Bestaande klanten houden hun eigen instellingen, maar moeten vóór die datum in hun beveiligingsinstellingen aangeven of ze meegaan.
De categorie Agent is precies waar de meting van TollBit over gaat: Cloudflare noemt chat-fetchbots als ChatGPT-User er expliciet in. Wat een aanbieder in zijn eigen documentatie kan afwijzen, wordt op die laag een beslissing van het netwerk, genomen voordat het verzoek de server bereikt. Welke crawlers je in robots.txt en in Cloudflare afzonderlijk kunt toestaan of weren zonder je gewone Google-vindbaarheid te raken verandert daar niet door. Wat verandert, is of die keuze ook effect heeft.
De verschuiving zit dus niet in het cijfer maar in de laag waarop de beslissing valt. Robots.txt blijft werken waar het altijd al werkte, als zichtbaarheidssignaal: OpenAI honoreert een disallow voor OAI-SearchBot netjes, met als prijs dat de site uit de zoekantwoorden van ChatGPT verdwijnt. Als barrière tegen fetchers is het bestand aantoonbaar poreus, en dat gat wordt niet gedicht met betere afspraken maar met infrastructuur: een netwerk dat meer dan een vijfde van alle webdomeinen bedient en per categorie ja of nee zegt. Wie zijn AI-beleid tot nu toe uitsluitend in een tekstbestand had staan, merkt de komende maand of dat beleid ooit iets heeft tegengehouden.
Veelgestelde vragen
Blokkeren op de juiste laag
Ik zoek met je uit waar je regels voor AI-bots echt worden afgedwongen en waar ze alleen op papier staan, en bouw daarna de koppeling tussen je site, je CDN en je eigen dashboard zodat je ziet wie er binnenkomt. Van meedenken en ontwerpen tot bouwen en automatiseren, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
