• AI-SEO

De 5 bedste måder at rette robots.txt til AI-crawlere på, efter at have tjekket 219 domæner

  • Felix Rose-Collins
  • 5 min read

Indledning

Alle artikler om AI-crawlere advarer dig mod den samme fejl. Du blokerede GPTBot under scraping-panikken i 2023, lyder advarslen, og du fangede ved et uheld de nyere agenter, der henter sider til brug i live-svar. Du havde til hensigt at stoppe trænings-scrapere og valgte dermed ubevidst at fravælge at blive anbefalet.

Vi har undersøgt, om det rent faktisk sker.

På tværs af 219 domæner skete det nul gange.

Ikke sjældent. Ikke i en håndfuld tilfælde. Ikke én eneste gang.

Metode

Vi tog de tyve øverste organiske resultater for 26 kommercielle søgeforespørgsler fordelt på syv kategorier: SaaS, e-handel, finans, sundhed, rejser, bolig og marketing. Det gav 254 unikke domæner. Vi hentede robots.txt for hvert enkelt den 28. juli 2026, og 219 kunne løses. Syv af disse leverede slet ingen robots.txt, hvilket tæller som at tillade alt.

For hvert domæne afprøvede vi hver AI-brugeragent mod filen ved hjælp af standardreglen for prioritet: den mest specifikke matchende User-agent-gruppe vinder, så et nøjagtigt agentmatch tilsidesætter *. Et domæne regnes for at blokere en agent, når den vindende gruppe ikke tillader rodmappen på webstedet uden en mere specifik tilladelse.

Tolv agenter blev kontrolleret, opdelt efter deres indholdsform.

Agent Operatør Feeds
GPTBot OpenAI træning
OAI-SearchBot OpenAI ChatGPT-søgnedslag
ClaudeBot Anthropic træning
Claude-SearchBot Anthropic Claude-søgning efter citater
PerplexityBot Perplexity svar
DuckAssistBot DuckDuckGo svar
Amazonbot Amazon svar
CCBot Common Crawl et korpus, som mange modeller trækker på
Google-Extended Google Gemini-træning, ikke søgning
Applebot-Extended Apple træning
Bytespider ByteDance uddannelse
meta-externalagent Meta træning

Resultater

77 % af disse domæner tillader alle AI-agenter. 23 % blokerer mindst én.

Agent Blokeret Domæner, der nævner det eksplicit
Bytespider 20 % 45
CCBot 20 47
ClaudeBot 17 % 50
Google-Udvidet 16 % 46
meta-externalagent 16 38
PerplexityBot 15 44
GPTBot 14 % 53
Applebot-Extended 14 39
Amazonbot 13 39
Claude-SearchBot 10 % 22
DuckAssistBot 10 % 24
OAI-SearchBot 9 % 34

Den agent, der blokeres mindst ofte, er den, der henter sider, som ChatGPT kan citere. De agenter, der blokeres oftest, er dem, der scraper til træningskorpora.

Mød Ranktracker

Alt-i-en-platformen til effektiv SEO

Bag enhver succesfuld virksomhed ligger en stærk SEO-kampagne. Men med utallige optimeringsværktøjer og -teknikker at vælge imellem kan det være svært at vide, hvor man skal starte. Nå, frygt ikke mere, for jeg har lige det, der kan hjælpe dig. Jeg præsenterer Ranktracker alt-i-en platformen til effektiv SEO

Vi har endelig åbnet for gratis registrering til Ranktracker!

Opret en gratis konto

Eller logge ind med dine legitimationsoplysninger

Denne rækkefølge er ikke tilfældig, og den udgør hele konklusionen.

Ingen begår fejlen. Alle træffer en beslutning

Se på de to operatører, der driver både en træningscrawler og en søgecrawler.

Blokerer begge Blokerer træning, tillader søgning Blokerer søgning, tillader træning
OpenAI, GPTBot / OAI-SearchBot 9 % 5 % 0
Anthropic, ClaudeBot / Claude-SearchBot 10 % 7 0

Tolv domæner blokerer GPTBot, mens de bevidst tillader OAI-SearchBot. Femten gør det samme for Anthropic. Det er en sammenhængende politik: Træn ikke på mit indhold, men citer mig gerne.

Ingen gør det omvendte.

To yderligere tal peger i samme retning. Kun fire domæner i hele stikprøven bruger en generel User-agent: * root-afvisning, og præcis ét blokerer en AI-agent uden eksplicit at nævne nogen AI-agent ved navn. Den, der redigerer disse filer, ved, hvilke agenter der findes, og hvad hver enkelt gør.

Brancheadvarslen vedrører altså et problem, der i denne stikprøve ikke eksisterer. Det interessante spørgsmål er ikke, om man har blokeret søgeagenterne ved et uheld. Det er, om man gjorde det med vilje.

For 18 % af disse domæner blokerer mindst én søgeagent, og 4 % blokerer alle fire. Disse websteder har valgt ikke at blive vist i AI-svar, og ud fra disse oplysninger gjorde de det med vilje.

De 5 måder, du kan rette op på det i dag

  1. Behandl træning og søgning som to separate spørgsmål. Det er forskellige beslutninger, og markedet har allerede adskilt dem. De fleste udgivere ønsker det andet uden det første. Skriv filen på den måde i stedet for at behandle "AI-crawlere" som én kategori.

  2. Navngiv hver agent eksplicit. Kun fire domæner her benytter sig af jokertegn, og det er der en god grund til: En simpel User-agent: * disallow fanger agenter, der ikke eksisterede, da du skrev den, og vil fange agenter, der endnu ikke eksisterer. To af de mest blokerede agenter i disse resultater, Bytespider og meta-externalagent, er nyere end de fleste af de robots.txt-anbefalinger, der stadig cirkulerer.

  3. Tjek OAI-SearchBot og Claude-SearchBot ved navn. Disse to afgør, om du kan blive citeret. Ni og ti procent af stikprøven blokerer dem. Hvis du er i den gruppe og ikke havde til hensigt at være det, er det denne linje, du skal ændre, og det er det eneste punkt på denne liste, der har en umiddelbar omkostning i form af synlighed.

  4. Gennemfør en ny kontrol hvert kvartal. Der er dukket nye agenter op flere gange i løbet af det seneste år. En fil, der blev skrevet for atten måneder siden, mangler poster, uanset hvor omhyggeligt den blev udarbejdet dengang.

  5. Kontroller i yderkanten, ikke kun i filen. Regler for bot-styring på dit CDN kan blokere en agent, som robots.txt udtrykkeligt tillader, og filen vil ikke fortælle dig noget om det. Dette er den fejl, der overlever en perfekt robots.txt.

Et udgangspunkt, der adskiller de to beslutninger:

# Citer mig. Disse henter sider, der skal citeres i live-svar.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Mød Ranktracker

Alt-i-en-platformen til effektiv SEO

Bag enhver succesfuld virksomhed ligger en stærk SEO-kampagne. Men med utallige optimeringsværktøjer og -teknikker at vælge imellem kan det være svært at vide, hvor man skal starte. Nå, frygt ikke mere, for jeg har lige det, der kan hjælpe dig. Jeg præsenterer Ranktracker alt-i-en platformen til effektiv SEO

Vi har endelig åbnet for gratis registrering til Ranktracker!

Opret en gratis konto

Eller logge ind med dine legitimationsoplysninger

User-agent: DuckAssistBot Allow: /

Træn ikke på mig. Skift disse til Allow, hvis du er uenig.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Det svarer stort set til den konfiguration, som tolv til femten domæner i denne prøve allerede kører med. Det er nu en almindelig praksis snarere end en smart løsning.

Hvorfor intet af dette vises i en rapport, du allerede kører

Search Console rapporterer om Googlebot. Den siger intet om OAI-SearchBot. Analytics rapporterer om sessioner, og en søgemaskine, der aldrig henviser til dig, sender ingen sessioner, der kan mangle. Placeringssporere rapporterer om placeringer, og dine placeringer påvirkes ikke af noget af dette.

Mød Ranktracker

Alt-i-en-platformen til effektiv SEO

Bag enhver succesfuld virksomhed ligger en stærk SEO-kampagne. Men med utallige optimeringsværktøjer og -teknikker at vælge imellem kan det være svært at vide, hvor man skal starte. Nå, frygt ikke mere, for jeg har lige det, der kan hjælpe dig. Jeg præsenterer Ranktracker alt-i-en platformen til effektiv SEO

Vi har endelig åbnet for gratis registrering til Ranktracker!

Opret en gratis konto

Eller logge ind med dine legitimationsoplysninger

Der er to måder at opdage det på. Læs filen direkte, hvilket er, hvad denne undersøgelse gjorde. Eller arbejd baglæns ud fra symptomet med en AI-synlighedstjekker, hvor du stiller søgemaskinerne spørgsmål om din kategori efter en fast tidsplan og holder øje med det svar, der siger, at de slet ikke kan se dig.

Den crawler-revision, der ligger til grund for denne undersøgelse, er den, vi kører i Honeyb, hvor vi sammenligner hver enkelt navngivet agent i ovenstående katalog med et websteds robotregler efter en fast tidsplan i stedet for som en engangsforeteelse. Adgang er den første af fire ting, den tjekker. De tre andre er, om søgemaskinerne anbefaler dig, hvad der specifikt skal ændres, og derefter at producere og udgive det indhold, der ændrer det.

To begrænsninger, der er værd at nævne

Denne stikprøve består af kommercielle SERP'er i USA, så den er skæv i retning af store udgivere og etablerede mærker, som både har den nødvendige bevidsthed og den juridiske rådgivning til at træffe en velovervejet beslutning her. En stikprøve af hjemmesider for små virksomheder ville meget sandsynligt se anderledes ud, og historien om utilsigtet blokering kunne meget vel vise sig at være sand der. Det vil vi undersøge næste gang.

Og en robots.txt-fil registrerer hensigt, ikke håndhævelse. Vi har ikke testet, om disse domæner rent faktisk leverer indhold til hver enkelt agent, hvilket er der, hvor CDN-reglerne gælder, og hvor kløften mellem filen og virkeligheden ofte opstår.

Platformen bag denne undersøgelse findes på honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Begynd at bruge Ranktracker... Gratis!

Find ud af, hvad der forhindrer dit websted i at blive placeret på ranglisten.

Opret en gratis konto

Eller logge ind med dine legitimationsoplysninger

Different views of Ranktracker app