Verweerd rond verbodsbord met de tekst No Entry, vastgeschroefd op een hekwerk van gaas
Nieuws15 augustus · 16:086 min leestijd

15 procent van de AI-fetchers in Europa haalt geblokkeerde pagina's op

Ongeveer 15 procent van de herkende AI-fetchers in Europa haalde pagina's op die sites in robots.txt hadden verboden, meet TollBit. Drie bots kwamen op bijna de helft van de sites die hen noemden alsnog binnen.

Ongeveer 15 procent van de herkende AI-fetchers in Europa haalde pagina's op die de site in robots.txt had verboden, meet contentplatform TollBit in zijn halfjaarrapport State of the Bots over de eerste helft van 2026.

Het gaat om een specifieke soort bot. Niet de trainingscrawler die het web afgraast voor modeldata, en niet de zoekcrawler die pagina's indexeert, maar de fetcher die één losse pagina ophaalt op het moment dat iemand een vraag typt in ChatGPT of Perplexity. Voor wie in Nederland een site of webshop beheert, verschuift daarmee de vraag van "staat er iets over AI-bots in mijn robots.txt" naar "draait die blokkade ook op een laag die hem kan afdwingen". Die vraag heeft een datum. Op 15 september, precies een maand na vandaag, zet Cloudflare zijn standaardinstellingen om.

Drie fetchers komen op bijna de helft van de sites langs de disallow

De 15 procent is een gemiddelde over een scheve verdeling. ChatGPT-User van OpenAI, Bytespider van ByteDance en Youbot bereikten verboden pagina's op bijna de helft van de Europese sites die hen met naam en toenaam in robots.txt hadden staan. ChatGPT-User raakte daarvan de meeste sites en is tegelijk de fetcher die het vaakst met naam wordt geblokkeerd. Dat is geen tegenspraak maar rekenkunde: de bot die het vaakst wordt aangesproken, is ook de bot die het vaakst betrapt kan worden.

TollBit telt elk verzoek aan een verboden URL als een overtreding, ongeacht wat de documentatie van de aanbieder over de eigen naleving zegt. De maatstaf meet dus wat er in de serverlogs staat, niet wat er is toegezegd.

Europa schrijft de nieuwe fetchers veel minder vaak op

Dezelfde meting laat zien hoe weinig Europese sites die bots überhaupt benoemen. Claude-User van Anthropic staat op 9 procent van de Europese sites in een disallow-regel, tegen 26 procent in Noord-Amerika. Perplexity-User komt uit op 13 tegen 26 procent. De meeste nieuwere fetchers blijven in Europa in de enkele cijfers steken.

Aandeel sites met een disallow-regel voor deze AI-fetchers, Europa tegen Noord-Amerika (bron: TollBit, State of the Bots eerste helft 2026)

Daar hoort een kanttekening bij die het rapport zelf maakt. Een laag aantal geconstateerde overtredingen bewijst geen net gedrag, maar kan simpelweg betekenen dat vrijwel niemand die bot ooit heeft benoemd. Een regel die nooit is geschreven, valt ook niet te overtreden.

Het Nederlandse beeld sluit daarop aan. Eerder onderzoek naar honderd webshops vond dat 74 van de 89 leesbare robots.txt-bestanden geen enkele AI-crawler noemen, en dat een deel van de shops die wel iets hadden ingesteld dat onbedoeld deed via de standaard van hun server of securityplugin.

OpenAI en Anthropic zijn het openlijk oneens

Waarom een disallow-regel voor ChatGPT-User minder gewicht heeft dan een sitebeheerder aanneemt, staat in OpenAI's eigen documentatie. ChatGPT-User bezoekt een pagina wanneer een gebruiker een vraag stelt, en omdat die actie door een gebruiker wordt gestart, gelden robots.txt-regels mogelijk niet, schrijft het bedrijf erbij. Perplexity neemt hetzelfde standpunt in voor Perplexity-User.

Anthropic doet dat niet. Het bedrijf documenteert drie bots, ClaudeBot voor training, Claude-User voor pagina's die iemand tijdens een gesprek laat ophalen en Claude-SearchBot voor de zoekindex, en stelt dat alle drie de standaardrichtlijnen in robots.txt respecteren. Hetzelfde bestand, hetzelfde soort verkeer, twee onverenigbare posities over de vraag of het bestand geldt.

Europese sites krijgen meer verkeer en minder terug

Het bredere beeld in het rapport is dat Europese uitgevers er op elk front slechter uit komen. TollBit meet dat de mediane Europese site vier keer zoveel AI-scrapes krijgt als een Noord-Amerikaanse, en dat de robots.txt-instructies van die site 2,8 keer zo vaak worden genegeerd. Het aantal scrapes op Europese sites lag in juni bijna 20 procent hoger dan in januari 2026.

Wat er tegenover staat is minimaal. Een Europese uitgever heeft 179 AI-botbezoeken nodig voor één doorverwezen menselijke bezoeker, ruim drie keer zo slecht als in Noord-Amerika, en die verhouding verslechterde binnen het halfjaar van 150 op 1 in het eerste kwartaal naar 227 op 1 in het tweede. AI-apps waren goed voor 0,05 procent van alle menselijke verwijzingen naar Europese sites. Cloudflare kwam eerder op dezelfde orde van grootte uit en mat bij grote AI-crawlers tussen de 118 en bijna 50.000 crawls per doorverwezen bezoeker.

De analyse beslaat 3.906 uitgevers, waarvan 456 Europese, met titels als The Telegraph, Ringier en Styria. TollBit-medeoprichter Olivia Joslin wijst als mogelijke verklaring op taal: Europa kent meer talen dan Noord-Amerika, en modellen die al die talen willen leren halen hun materiaal uit navenant meer bronnen.

Alle cijfers gaan bovendien alleen over bots die zichzelf bekendmaken. TollBit tekent daarbij aan dat scrapers zich voordoen als andere user agents, IP-adressen wisselen en via residentiële proxy's binnenkomen, waardoor de werkelijke omvang hoger ligt dan het rapport laat zien. In een voorbeeld uit de eigen audit van het bedrijf probeert een scraper eerst als Googlebot binnen te komen, wordt geweigerd, en haalt de pagina binnen drie seconden als Chrome alsnog op.

Tijdlijn van vijf verzoeken aan één pagina: het eerste verzoek komt als Googlebot binnen en wordt geblokkeerd, daarna volgen twee omleidingen en twee geslaagde verzoeken als Chrome. Bron: TollBit, State of the Bots Q1 en Q2 2026
Tijdlijn van vijf verzoeken aan één pagina: het eerste verzoek komt als Googlebot binnen en wordt geblokkeerd, daarna volgen twee omleidingen en twee geslaagde verzoeken als Chrome. Bron: TollBit, State of the Bots Q1 en Q2 2026

De omslag van 15 september

Cloudflare deelt botverkeer sinds 1 juli op in Search, Agent en Training, en blokkeert vanaf 15 september 2026 de categorieën Agent en Training standaard op advertentiepagina's van nieuwe domeinen. Bestaande klanten houden hun eigen instellingen, maar moeten vóór die datum in hun beveiligingsinstellingen aangeven of ze meegaan.

De categorie Agent is precies waar de meting van TollBit over gaat: Cloudflare noemt chat-fetchbots als ChatGPT-User er expliciet in. Wat een aanbieder in zijn eigen documentatie kan afwijzen, wordt op die laag een beslissing van het netwerk, genomen voordat het verzoek de server bereikt. Welke crawlers je in robots.txt en in Cloudflare afzonderlijk kunt toestaan of weren zonder je gewone Google-vindbaarheid te raken verandert daar niet door. Wat verandert, is of die keuze ook effect heeft.

De verschuiving zit dus niet in het cijfer maar in de laag waarop de beslissing valt. Robots.txt blijft werken waar het altijd al werkte, als zichtbaarheidssignaal: OpenAI honoreert een disallow voor OAI-SearchBot netjes, met als prijs dat de site uit de zoekantwoorden van ChatGPT verdwijnt. Als barrière tegen fetchers is het bestand aantoonbaar poreus, en dat gat wordt niet gedicht met betere afspraken maar met infrastructuur: een netwerk dat meer dan een vijfde van alle webdomeinen bedient en per categorie ja of nee zegt. Wie zijn AI-beleid tot nu toe uitsluitend in een tekstbestand had staan, merkt de komende maand of dat beleid ooit iets heeft tegengehouden.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Blokkeren op de juiste laag

Ik zoek met je uit waar je regels voor AI-bots echt worden afgedwongen en waar ze alleen op papier staan, en bouw daarna de koppeling tussen je site, je CDN en je eigen dashboard zodat je ziet wie er binnenkomt. Van meedenken en ontwerpen tot bouwen en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

AI-crawlers toelaten of blokkeren: een keuzegids voor je robots.txt en Cloudflare-instellingen
Gids
9 min

2 jul 09:00

AI-crawlers toelaten of blokkeren: een keuzegids voor je robots.txt en Cloudflare-instellingen

Geef je GPTBot, ClaudeBot en soortgenoten toegang of hou je ze buiten? Een stappenplan om per crawler te beslissen, het correct in te stellen en de impact te meten.

83 procent van Nederlandse webshops noemt geen enkele AI-crawler in robots.txt
Nieuws
4 min

28 jul 08:12

83 procent van Nederlandse webshops noemt geen enkele AI-crawler in robots.txt

Onderzoek naar de robots.txt van 100 Nederlandse webshops laat zien dat 74 van de 89 leesbare bestanden geen enkele AI-crawler noemt. Daarmee beslist de standaardinstelling van hosting of plugin wie je productpagina's mag lezen.

Zenity Labs kaapt vijf AI-browsers zonder één klik van de gebruiker
Nieuws
5

6 aug 14:11

Zenity Labs kaapt vijf AI-browsers zonder één klik van de gebruiker

Zenity Labs demonstreerde op Black Hat 2026 werkende zero-click aanvallen op Claude in Chrome, Gemini, Comet, ChatGPT Atlas en Copilot Edge. Een deel van de leveranciers patchte, een ander deel noemt het gedrag bedoeld ontwerp.

Anthropic tekent Koreaanse datacenterafspraak met SK Telecom en Claude-deal met Samsung SDS
Nieuws
5 min

26 jul 22:11

Anthropic tekent Koreaanse datacenterafspraak met SK Telecom en Claude-deal met Samsung SDS

Anthropic tekende op de AI-top in San Francisco een intentieverklaring met SK Telecom over gigawattdatacenters in Korea en een strategisch partnerschap met Samsung SDS, dat Claude Enterprise al aan 70.000 Samsung-medewerkers levert.

Je AI-browser handelt namens jou. Beveilig je nog steeds alleen de gebruiker?
Inzicht
7 min

19 jul 13:00

Je AI-browser handelt namens jou. Beveilig je nog steeds alleen de gebruiker?

Agentische AI-browsers laten de assistent zelf klikken, invullen en inloggen met jouw sessie. Elke extensie of pagina die de AI misleidt, wordt een directe route naar je accounts. Bestaande browserbeveiliging is daar niet op gebouwd.

BioShocking-aanval laat AI-browsers als Atlas en Comet hun guardrails vergeten
Nieuws
5 min

1 jul 00:06

BioShocking-aanval laat AI-browsers als Atlas en Comet hun guardrails vergeten

Beveiligingsonderzoekers misleiden zes AI-browsers, waaronder ChatGPT Atlas en Comet, met een spelletje waarin 2 plus 2 ineens 5 is. Het resultaat: de guardrails verdwijnen en inloggegevens lekken.