• AI-SEO

De 5 beste måtene å tilpasse robots.txt for AI-crawlere på, etter å ha sjekket 219 domener

  • Felix Rose-Collins
  • 5 min read

Innledning

Hver eneste artikkel om AI-crawlere advarer deg mot den samme feilen. Du blokkerte GPTBot under scraping-panikken i 2023, lyder advarselen, og du fanget ved et uhell opp de nyere agentene som henter sider for å sitere i live-svar. Du hadde tenkt å stoppe trenings-scraperne, og du valgte i all stillhet å ikke bli anbefalt.

Vi sjekket om dette faktisk skjer.

På tvers av 219 domener skjedde det null ganger.

Ikke sjelden. Ikke i en håndfull tilfeller. Ikke én eneste gang.

Metode

Vi tok de tjue øverste organiske resultatene for 26 kommersielle søk fordelt på syv kategorier: SaaS, e-handel, finans, helse, reise, bolig og markedsføring. Det ga 254 unike domener. Vi hentet robots.txt for hvert av dem 28. juli 2026, og 219 ble løst. Syv av disse hadde ikke noen robots.txt i det hele tatt, noe som regnes som å tillate alt.

For hvert domene sjekket vi hver AI-brukeragent mot filen ved å bruke standardprioritetsregelen: den mest spesifikke User-agent-gruppen som samsvarer, vinner, så et eksakt agenttreff overstyrer *. Et domene regnes som å blokkere en agent når den vinnende gruppen ikke tillater nettstedets rot uten en mer spesifikk tillatelse.

Tolv agenter ble sjekket, inndelt etter hva de sender.

Agent Operatør Feeds
GPTBot OpenAI opplæring
OAI-SearchBot OpenAI ChatGPT-søk etter sitater
ClaudeBot Anthropic opplæring
Claude-SearchBot Anthropic Claude-søk etter sitater
PerplexityBot Perplexity svar
DuckAssistBot DuckDuckGo svar
Amazonbot Amazon svar
CCBot Common Crawl et korpus som mange modeller benytter seg av
Google-Extended Google Gemini-opplæring, ikke søk
Applebot-Extended Apple opplæring
Bytespider ByteDance opplæring
meta-ekstern agent Meta opplæring

Resultater

77 % av disse domenene tillater alle AI-agenter. 23 % blokkerer minst én.

Agent Blokkert Domener som nevner det eksplisitt
Bytespider 20 % 45
CCBot 20 % 47
ClaudeBot 17 % 50
Google-Extended 16 % 46
meta-externalagent 16 % 38
PerplexityBot 15 % 44
GPTBot 14 % 53
Applebot-Extended 14 % 39
Amazonbot 13 % 39
Claude-SearchBot 10 % 22
DuckAssistBot 10 % 24
OAI-SearchBot 9 % 34

Agenten som ble blokkert sjeldnest, er den som henter sider som ChatGPT kan sitere fra. Agentene som ble blokkert oftest, er de som skraper for å samle inn tekstkorpus til opplæring.

Møt Ranktracker

Alt-i-ett-plattformen for effektiv søkemotoroptimalisering

Bak enhver vellykket bedrift ligger en sterk SEO-kampanje. Men med utallige optimaliseringsverktøy og teknikker der ute å velge mellom, kan det være vanskelig å vite hvor du skal begynne. Vel, frykt ikke mer, for jeg har akkurat det som kan hjelpe deg. Vi presenterer Ranktracker alt-i-ett-plattformen for effektiv SEO.

Vi har endelig åpnet registreringen til Ranktracker helt gratis!

Opprett en gratis konto

Eller logg inn med påloggingsinformasjonen din

Denne rekkefølgen er ikke tilfeldig, og det er selve funnet.

Ingen gjør en feil. Alle tar en beslutning

Se på de to operatørene som driver både en treningscrawler og en søkecrawler.

Blokkerer begge Blokkerer opplæring, tillater søk Blokkerer søk, tillater opplæring
OpenAI, GPTBot / OAI-SearchBot 9 % 5 % 0 %
Anthropic, ClaudeBot / Claude-SearchBot 10 % 7 % 0

Tolv domener blokkerer GPTBot mens de bevisst tillater OAI-SearchBot. Femten gjør det samme for Anthropic. Det er en konsekvent policy: ikke tren på innholdet mitt, men siter meg gjerne.

Ingen gjør det motsatte.

To tall til peker i samme retning. Bare fire domener i hele utvalget bruker en generell User-agent: * root-blokkering, og nøyaktig ett blokkerer en AI-agent uten å nevne noen AI-agent eksplisitt. Den som redigerer disse filene, vet hvilke agenter som finnes og hva hver enkelt gjør.

Så bransjeadvarselen tar opp et problem som, i dette utvalget, ikke eksisterer. Det interessante spørsmålet er ikke om du blokkerte søkeagentene ved et uhell. Det er om du hadde til hensikt å gjøre det.

For 18 % av disse domenene blokkerer minst én søkeagent, og 4 % blokkerer alle fire. Disse nettstedene har valgt å ikke vises i AI-svar, og ut fra dette beviset gjorde de det med vilje.

De 5 måtene å fikse ditt i dag

  1. Behandle opplæring og søk som to separate spørsmål. Det er forskjellige beslutninger, og markedet har allerede skilt dem fra hverandre. De fleste utgivere ønsker det andre uten det første. Skriv filen på den måten i stedet for å behandle «AI-crawlere» som én kategori.

  2. Navngi hver agent eksplisitt. Bare fire domener her bruker jokertegn, og det er av god grunn: en ren User-agent: * disallow fanger opp agenter som ikke eksisterte da du skrev den, og vil fange opp agenter som ikke eksisterer ennå. To av de mest blokkerte agentene i disse resultatene, Bytespider og meta-externalagent, er nyere enn de fleste av de robots.txt-rådene som fortsatt sirkulerer.

  3. Sjekk OAI-SearchBot og Claude-SearchBot ved navn. Disse to avgjør om du kan bli sitert. Ni og ti prosent av utvalget blokkerer dem. Hvis du er i den gruppen og ikke hadde tenkt å være det, er dette linjen du må endre, og det er det eneste punktet på denne listen som har en umiddelbar kostnad for synligheten.

  4. Gjennomfør ny revisjon hvert kvartal. Nye agenter har dukket opp flere ganger det siste året. En fil som ble skrevet for atten måneder siden, mangler oppføringer uansett hvor nøye den ble skrevet den gangen.

  5. Kontroller i ytterkantene, ikke bare i filen. Regler for bot-håndtering i ditt CDN kan blokkere en agent som robots.txt eksplisitt tillater, og filen vil ikke gi deg noen informasjon om dette. Dette er feilen som overlever selv en perfekt robots.txt.

Et utgangspunkt som skiller de to beslutningene:

# Siter meg. Disse henter sider for å sitere i sanntidssvar.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Møt Ranktracker

Alt-i-ett-plattformen for effektiv søkemotoroptimalisering

Bak enhver vellykket bedrift ligger en sterk SEO-kampanje. Men med utallige optimaliseringsverktøy og teknikker der ute å velge mellom, kan det være vanskelig å vite hvor du skal begynne. Vel, frykt ikke mer, for jeg har akkurat det som kan hjelpe deg. Vi presenterer Ranktracker alt-i-ett-plattformen for effektiv SEO.

Vi har endelig åpnet registreringen til Ranktracker helt gratis!

Opprett en gratis konto

Eller logg inn med påloggingsinformasjonen din

User-agent: DuckAssistBot Allow: /

Ikke bruk meg til opplæring. Endre disse til «Allow» hvis du er uenig.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Dette ligner på konfigurasjonen som tolv til femten domener i dette eksemplet allerede bruker. Det er nå en vanlig praksis, snarere enn en smart løsning.

Hvorfor ingenting av dette vises i en rapport du allerede kjører

Search Console rapporterer om Googlebot. Den sier ingenting om OAI-SearchBot. Analytics rapporterer om økter, og en søkemotor som aldri indekserer deg, sender ingen økter som kan mangle. Rangeringstjenester rapporterer om posisjoner, og posisjonene dine påvirkes ikke av noe av dette.

Møt Ranktracker

Alt-i-ett-plattformen for effektiv søkemotoroptimalisering

Bak enhver vellykket bedrift ligger en sterk SEO-kampanje. Men med utallige optimaliseringsverktøy og teknikker der ute å velge mellom, kan det være vanskelig å vite hvor du skal begynne. Vel, frykt ikke mer, for jeg har akkurat det som kan hjelpe deg. Vi presenterer Ranktracker alt-i-ett-plattformen for effektiv SEO.

Vi har endelig åpnet registreringen til Ranktracker helt gratis!

Opprett en gratis konto

Eller logg inn med påloggingsinformasjonen din

Det finnes to måter å oppdage dette på. Les filen direkte, noe denne studien gjorde. Eller gå baklengs ut fra symptomet med et AI-verktøy for synlighetskontroll, ved å stille søkemotorene spørsmål innenfor din kategori etter en fast tidsplan og se etter svaret som sier at de ikke kan se deg i det hele tatt.

Crawler-revisjonen bak denne studien er den vi kjører i Honeyb, der vi sjekker hver enkelt agent i katalogen ovenfor mot nettstedets robotregler etter en fast tidsplan, i stedet for som en engangsforeteelse. Tilgang er det første av fire elementer den sjekker. De tre andre er om søkemotorene anbefaler deg, hva du konkret bør endre, og deretter å produsere og publisere innholdet som endrer dette.

To begrensninger verdt å nevne

Dette utvalget består av kommersielle SERP-er i USA, så det er skjevt i retning av store utgivere og etablerte merkevarer, som både har bevisstheten og den juridiske veiledningen som trengs for å ta en gjennomtenkt beslutning her. Et utvalg av nettsteder for småbedrifter ville svært sannsynlig se annerledes ut, og historien om utilsiktet blokkering kan godt vise seg å være sann der. Det vil vi undersøke neste gang.

Og en robots.txt-fil registrerer intensjon, ikke håndhevelse. Vi testet ikke om disse domenene faktisk leverer innhold til hver enkelt agent, noe som er der CDN-reglene gjelder og der gapet mellom filen og virkeligheten ofte oppstår.

Plattformen bak denne studien finnes på honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Begynn å bruke Ranktracker... Gratis!

Finn ut hva som hindrer nettstedet ditt i å bli rangert.

Opprett en gratis konto

Eller logg inn med påloggingsinformasjonen din

Different views of Ranktracker app