Inleiding
In elk artikel over AI-crawlers word je gewaarschuwd voor dezelfde fout. Je hebt GPTBot geblokkeerd tijdens de scraping-paniek van 2023, zo luidt de waarschuwing, en daarbij heb je per ongeluk ook de nieuwere agents tegengehouden die pagina's ophalen om te citeren in live antwoorden. Je wilde de trainingsscrapers tegenhouden en hebt daarmee stilletjes afgezien van aanbevelingen.
We hebben gecontroleerd of dat daadwerkelijk gebeurt.
Op 219 domeinen is het nul keer voorgekomen.
Niet zelden. Niet in een handvol gevallen. Niet één keer.
Methode
We hebben de twintig beste organische resultaten genomen voor 26 commerciële zoekopdrachten in zeven categorieën: SaaS, e-commerce, financiën, gezondheid, reizen, wonen en marketing. Dat leverde 254 unieke domeinen op. We hebben op 28 juli 2026 voor elk domein het robots.txt-bestand opgehaald, en 219 daarvan konden worden verwerkt. Zeven daarvan leverden helemaal geen robots.txt-bestand op, wat geldt als ‘alles toestaan’.
Voor elk domein hebben we elke AI-user-agent tegen het bestand getoetst met behulp van de standaardprioriteitsregel: de meest specifieke overeenkomende User-agent-groep wint, dus een exacte agent-match heeft voorrang op *. Een domein wordt beschouwd als een agent blokkerend wanneer de winnende groep de siteroot niet toestaat zonder een specifiekere toestemming.
Er werden twaalf agents gecontroleerd, ingedeeld op basis van wat ze doorgeven.
| Agent | Operator | Feeds |
| GPTBot | OpenAI | training |
| OAI-SearchBot | OpenAI | ChatGPT-zoekresultaten |
| ClaudeBot | Anthropic | training |
| Claude-SearchBot | Anthropic | Claude-zoekcitaten |
| PerplexityBot | Perplexity | antwoorden |
| DuckAssistBot | DuckDuckGo | antwoorden |
| Amazonbot | Amazon | antwoorden |
| CCBot | Common Crawl | een corpus waar veel modellen gebruik van maken |
| Google-Extended | Gemini-training, niet Search | |
| Applebot-Extended | Apple | training |
| Bytespider | ByteDance | training |
| meta-externalagent | Meta | training |
Resultaten
77% van deze domeinen staat elke AI-agent toe. Drieëntwintig procent blokkeert er ten minste één.
| Agent | Geblokkeerd | Domeinen die het expliciet noemen |
| Bytespider | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-uitgebreid | 16% | 46 |
| meta-externalagent | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| Claude-SearchBot | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
De agent die het minst vaak wordt geblokkeerd, is degene die pagina’s ophaalt die ChatGPT kan citeren. De agenten die het vaakst worden geblokkeerd, zijn degenen die gegevens verzamelen voor trainingscorpora.
Het alles-in-één platform voor effectieve SEO
Achter elk succesvol bedrijf staat een sterke SEO-campagne. Maar met talloze optimalisatietools en -technieken om uit te kiezen, kan het moeilijk zijn om te weten waar te beginnen. Nou, vrees niet meer, want ik heb precies het ding om te helpen. Ik presenteer het Ranktracker alles-in-één platform voor effectieve SEO
We hebben eindelijk de registratie voor Ranktracker helemaal gratis geopend!
Maak een gratis account aanOf log in met uw gegevens
Die volgorde is geen toeval, en dat is de kern van de bevinding.
Niemand maakt een fout. Iedereen neemt een beslissing
Kijk naar de twee exploitanten die zowel een trainingscrawler als een zoekcrawler beheren.
| Blokkeert beide | Blokkeert training, staat zoeken toe | Blokkeert zoeken, staat training toe | |
| OpenAI, GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic, ClaudeBot / Claude-SearchBot | 10% | 7% | 0% |
Twaalf domeinen blokkeren GPTBot terwijl ze OAI-SearchBot bewust toelaten. Vijftien doen hetzelfde voor Anthropic. Dat is een consistent beleid: train niet op mijn inhoud, maar citeer me wel.
Niemand doet het omgekeerde.
Nog twee cijfers wijzen in dezelfde richting. Slechts vier domeinen in de gehele steekproef hanteren een algemene User-agent: * root-blokkering, en precies één blokkeert een AI-agent zonder een AI-agent expliciet te noemen. Wie deze bestanden bewerkt, weet welke agents er bestaan en wat ze allemaal doen.
De waarschuwing van de sector richt zich dus op een probleem dat, in deze steekproef, niet bestaat. De interessante vraag is niet of je de zoekagenten per ongeluk hebt geblokkeerd. Het is of je dat met opzet hebt gedaan.
Want 18% van deze domeinen blokkeert ten minste één zoekagent en 4% blokkeert alle vier. Die sites hebben ervoor gekozen niet in AI-antwoorden te verschijnen, en op basis van dit bewijs hebben ze dat met opzet gedaan.
De 5 manieren om dit vandaag nog op te lossen
-
Behandel training en zoeken als twee afzonderlijke kwesties. Het zijn verschillende beslissingen en de markt heeft ze al gescheiden. De meeste uitgevers willen het tweede zonder het eerste. Schrijf het bestand op die manier in plaats van “AI-crawlers” als één categorie te behandelen.
-
Noem elke agent expliciet. Slechts vier domeinen hier vertrouwen op de wildcard, en met goede reden: een kale User-agent: * disallow vangt agents op die nog niet bestonden toen je het schreef, en zal agents opvangen die nog niet bestaan. Twee van de meest geblokkeerde agents in deze resultaten, Bytespider en meta-externalagent, zijn van latere datum dan het meeste robots.txt-advies dat nog steeds de ronde doet.
-
Controleer OAI-SearchBot en Claude-SearchBot op naam. Deze twee bepalen of je geciteerd kunt worden. Negen en tien procent van de steekproef blokkeert ze. Als je tot die groep behoort en dat niet de bedoeling was, is dit de regel die je moet aanpassen, en het is het enige item op deze lijst dat onmiddellijke zichtbaarheidskosten met zich meebrengt.
-
Voer elk kwartaal een nieuwe controle uit. Het afgelopen jaar zijn er meerdere keren nieuwe agents verschenen. Een bestand dat achttien maanden geleden is geschreven, mist vermeldingen, hoe zorgvuldig het destijds ook is opgesteld.
-
Controleer aan de rand, niet alleen in het bestand. Regels voor botbeheer bij je CDN kunnen een agent blokkeren die expliciet is toegestaan in robots.txt, en het bestand zal je daar niets over vertellen. Dit is de fout die zelfs een perfect robots.txt-bestand kan omzeilen.
Een uitgangspunt dat de twee beslissingen van elkaar onderscheidt:
# Citeer mij. Deze halen pagina’s op om te citeren in live antwoorden.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Maak kennis met RanktrackerHet alles-in-één platform voor effectieve SEO
Achter elk succesvol bedrijf staat een sterke SEO-campagne. Maar met talloze optimalisatietools en -technieken om uit te kiezen, kan het moeilijk zijn om te weten waar te beginnen. Nou, vrees niet meer, want ik heb precies het ding om te helpen. Ik presenteer het Ranktracker alles-in-één platform voor effectieve SEO
We hebben eindelijk de registratie voor Ranktracker helemaal gratis geopend!
Maak een gratis account aanOf log in met uw gegevens
User-agent: DuckAssistBot
Allow: /
Train niet op mij. Zet deze op Allow als je het hier niet mee eens bent.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Dat komt dicht in de buurt van de configuratie die twaalf tot vijftien domeinen in dit voorbeeld al hanteren. Het is tegenwoordig eerder een gangbare praktijk dan een slimme zet.
Waarom dit allemaal niet terugkomt in een rapport dat je al uitvoert
Search Console rapporteert Googlebot. Er wordt niets vermeld over OAI-SearchBot. Analytics rapporteert sessies, en een zoekmachine die je nooit vermeldt, stuurt geen sessies, dus die ontbreken ook niet. Positietrackers rapporteren posities, en jouw posities worden hierdoor niet beïnvloed.
Het alles-in-één platform voor effectieve SEO
Achter elk succesvol bedrijf staat een sterke SEO-campagne. Maar met talloze optimalisatietools en -technieken om uit te kiezen, kan het moeilijk zijn om te weten waar te beginnen. Nou, vrees niet meer, want ik heb precies het ding om te helpen. Ik presenteer het Ranktracker alles-in-één platform voor effectieve SEO
We hebben eindelijk de registratie voor Ranktracker helemaal gratis geopend!
Maak een gratis account aanOf log in met uw gegevens
Er zijn twee manieren om dit op te sporen. Lees het bestand rechtstreeks, wat in dit onderzoek is gedaan. Of werk terug vanuit het symptoom met een AI-zichtbaarheidschecker, waarbij je de zoekmachines volgens een schema vragen stelt over je categorie en let op het antwoord waarin staat dat ze je helemaal niet kunnen zien.
De crawler-audit achter dit onderzoek is degene die we bij Honeyb uitvoeren, waarbij elke genoemde agent in de bovenstaande catalogus volgens een schema – in plaats van eenmalig – wordt getoetst aan de robots-regels van een site. Toegang is het eerste van vier punten die worden gecontroleerd. De andere drie zijn of de zoekmachines je aanbevelen, wat er specifiek moet worden gewijzigd, en vervolgens het produceren en publiceren van de inhoud die deze wijzigingen doorvoert.
Twee beperkingen die het vermelden waard zijn
Deze steekproef betreft commerciële SERP’s in de VS, dus er is een vertekening in de richting van grote uitgevers en gevestigde merken, die zowel de bekendheid als het juridisch advies hebben om hier een weloverwogen beslissing te nemen. Een steekproef van websites van kleine bedrijven zou er hoogstwaarschijnlijk anders uitzien, en het verhaal over onbedoelde blokkering zou daar wel eens waar kunnen blijken te zijn. Dat zouden we vervolgens uitvoeren.
En een robots.txt-bestand legt de intentie vast, niet de handhaving. We hebben niet getest of deze domeinen daadwerkelijk inhoud aan elke agent aanbieden; dat is waar CDN-regels gelden en waar de kloof tussen het bestand en de werkelijkheid vaak groter wordt.
Het platform achter dit onderzoek is te vinden op honeyb.ai.

