Innledning
Hver eneste artikkel om AI-crawlere advarer deg mot den samme feilen. Du blokkerte GPTBot under scraping-panikken i 2023, lyder advarselen, og du fanget ved et uhell opp de nyere agentene som henter sider for å sitere i live-svar. Du hadde tenkt å stoppe trenings-scraperne, og du valgte i all stillhet å ikke bli anbefalt.
Vi sjekket om dette faktisk skjer.
På tvers av 219 domener skjedde det null ganger.
Ikke sjelden. Ikke i en håndfull tilfeller. Ikke én eneste gang.
Metode
Vi tok de tjue øverste organiske resultatene for 26 kommersielle søk fordelt på syv kategorier: SaaS, e-handel, finans, helse, reise, bolig og markedsføring. Det ga 254 unike domener. Vi hentet robots.txt for hvert av dem 28. juli 2026, og 219 ble løst. Syv av disse hadde ikke noen robots.txt i det hele tatt, noe som regnes som å tillate alt.
For hvert domene sjekket vi hver AI-brukeragent mot filen ved å bruke standardprioritetsregelen: den mest spesifikke User-agent-gruppen som samsvarer, vinner, så et eksakt agenttreff overstyrer *. Et domene regnes som å blokkere en agent når den vinnende gruppen ikke tillater nettstedets rot uten en mer spesifikk tillatelse.
Tolv agenter ble sjekket, inndelt etter hva de sender.
| Agent | Operatør | Feeds |
| GPTBot | OpenAI | opplæring |
| OAI-SearchBot | OpenAI | ChatGPT-søk etter sitater |
| ClaudeBot | Anthropic | opplæring |
| Claude-SearchBot | Anthropic | Claude-søk etter sitater |
| PerplexityBot | Perplexity | svar |
| DuckAssistBot | DuckDuckGo | svar |
| Amazonbot | Amazon | svar |
| CCBot | Common Crawl | et korpus som mange modeller benytter seg av |
| Google-Extended | Gemini-opplæring, ikke søk | |
| Applebot-Extended | Apple | opplæring |
| Bytespider | ByteDance | opplæring |
| meta-ekstern agent | Meta | opplæring |
Resultater
77 % av disse domenene tillater alle AI-agenter. 23 % blokkerer minst én.
| Agent | Blokkert | Domener som nevner det eksplisitt |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Agenten som ble blokkert sjeldnest, er den som henter sider som ChatGPT kan sitere fra. Agentene som ble blokkert oftest, er de som skraper for å samle inn tekstkorpus til opplæring.
Alt-i-ett-plattformen for effektiv søkemotoroptimalisering
Bak enhver vellykket bedrift ligger en sterk SEO-kampanje. Men med utallige optimaliseringsverktøy og teknikker der ute å velge mellom, kan det være vanskelig å vite hvor du skal begynne. Vel, frykt ikke mer, for jeg har akkurat det som kan hjelpe deg. Vi presenterer Ranktracker alt-i-ett-plattformen for effektiv SEO.
Vi har endelig åpnet registreringen til Ranktracker helt gratis!
Opprett en gratis kontoEller logg inn med påloggingsinformasjonen din
Denne rekkefølgen er ikke tilfeldig, og det er selve funnet.
Ingen gjør en feil. Alle tar en beslutning
Se på de to operatørene som driver både en treningscrawler og en søkecrawler.
| Blokkerer begge | Blokkerer opplæring, tillater søk | Blokkerer søk, tillater opplæring | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 % |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Tolv domener blokkerer GPTBot mens de bevisst tillater OAI-SearchBot. Femten gjør det samme for Anthropic. Det er en konsekvent policy: ikke tren på innholdet mitt, men siter meg gjerne.
Ingen gjør det motsatte.
To tall til peker i samme retning. Bare fire domener i hele utvalget bruker en generell User-agent: * root-blokkering, og nøyaktig ett blokkerer en AI-agent uten å nevne noen AI-agent eksplisitt. Den som redigerer disse filene, vet hvilke agenter som finnes og hva hver enkelt gjør.
Så bransjeadvarselen tar opp et problem som, i dette utvalget, ikke eksisterer. Det interessante spørsmålet er ikke om du blokkerte søkeagentene ved et uhell. Det er om du hadde til hensikt å gjøre det.
For 18 % av disse domenene blokkerer minst én søkeagent, og 4 % blokkerer alle fire. Disse nettstedene har valgt å ikke vises i AI-svar, og ut fra dette beviset gjorde de det med vilje.
De 5 måtene å fikse ditt i dag
-
Behandle opplæring og søk som to separate spørsmål. Det er forskjellige beslutninger, og markedet har allerede skilt dem fra hverandre. De fleste utgivere ønsker det andre uten det første. Skriv filen på den måten i stedet for å behandle «AI-crawlere» som én kategori.
-
Navngi hver agent eksplisitt. Bare fire domener her bruker jokertegn, og det er av god grunn: en ren User-agent: * disallow fanger opp agenter som ikke eksisterte da du skrev den, og vil fange opp agenter som ikke eksisterer ennå. To av de mest blokkerte agentene i disse resultatene, Bytespider og meta-externalagent, er nyere enn de fleste av de robots.txt-rådene som fortsatt sirkulerer.
-
Sjekk OAI-SearchBot og Claude-SearchBot ved navn. Disse to avgjør om du kan bli sitert. Ni og ti prosent av utvalget blokkerer dem. Hvis du er i den gruppen og ikke hadde tenkt å være det, er dette linjen du må endre, og det er det eneste punktet på denne listen som har en umiddelbar kostnad for synligheten.
-
Gjennomfør ny revisjon hvert kvartal. Nye agenter har dukket opp flere ganger det siste året. En fil som ble skrevet for atten måneder siden, mangler oppføringer uansett hvor nøye den ble skrevet den gangen.
-
Kontroller i ytterkantene, ikke bare i filen. Regler for bot-håndtering i ditt CDN kan blokkere en agent som robots.txt eksplisitt tillater, og filen vil ikke gi deg noen informasjon om dette. Dette er feilen som overlever selv en perfekt robots.txt.
Et utgangspunkt som skiller de to beslutningene:
# Siter meg. Disse henter sider for å sitere i sanntidssvar.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Møt RanktrackerAlt-i-ett-plattformen for effektiv søkemotoroptimalisering
Bak enhver vellykket bedrift ligger en sterk SEO-kampanje. Men med utallige optimaliseringsverktøy og teknikker der ute å velge mellom, kan det være vanskelig å vite hvor du skal begynne. Vel, frykt ikke mer, for jeg har akkurat det som kan hjelpe deg. Vi presenterer Ranktracker alt-i-ett-plattformen for effektiv SEO.
Vi har endelig åpnet registreringen til Ranktracker helt gratis!
Opprett en gratis kontoEller logg inn med påloggingsinformasjonen din
User-agent: DuckAssistBot
Allow: /
Ikke bruk meg til opplæring. Endre disse til «Allow» hvis du er uenig.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Dette ligner på konfigurasjonen som tolv til femten domener i dette eksemplet allerede bruker. Det er nå en vanlig praksis, snarere enn en smart løsning.
Hvorfor ingenting av dette vises i en rapport du allerede kjører
Search Console rapporterer om Googlebot. Den sier ingenting om OAI-SearchBot. Analytics rapporterer om økter, og en søkemotor som aldri indekserer deg, sender ingen økter som kan mangle. Rangeringstjenester rapporterer om posisjoner, og posisjonene dine påvirkes ikke av noe av dette.
Alt-i-ett-plattformen for effektiv søkemotoroptimalisering
Bak enhver vellykket bedrift ligger en sterk SEO-kampanje. Men med utallige optimaliseringsverktøy og teknikker der ute å velge mellom, kan det være vanskelig å vite hvor du skal begynne. Vel, frykt ikke mer, for jeg har akkurat det som kan hjelpe deg. Vi presenterer Ranktracker alt-i-ett-plattformen for effektiv SEO.
Vi har endelig åpnet registreringen til Ranktracker helt gratis!
Opprett en gratis kontoEller logg inn med påloggingsinformasjonen din
Det finnes to måter å oppdage dette på. Les filen direkte, noe denne studien gjorde. Eller gå baklengs ut fra symptomet med et AI-verktøy for synlighetskontroll, ved å stille søkemotorene spørsmål innenfor din kategori etter en fast tidsplan og se etter svaret som sier at de ikke kan se deg i det hele tatt.
Crawler-revisjonen bak denne studien er den vi kjører i Honeyb, der vi sjekker hver enkelt agent i katalogen ovenfor mot nettstedets robotregler etter en fast tidsplan, i stedet for som en engangsforeteelse. Tilgang er det første av fire elementer den sjekker. De tre andre er om søkemotorene anbefaler deg, hva du konkret bør endre, og deretter å produsere og publisere innholdet som endrer dette.
To begrensninger verdt å nevne
Dette utvalget består av kommersielle SERP-er i USA, så det er skjevt i retning av store utgivere og etablerte merkevarer, som både har bevisstheten og den juridiske veiledningen som trengs for å ta en gjennomtenkt beslutning her. Et utvalg av nettsteder for småbedrifter ville svært sannsynlig se annerledes ut, og historien om utilsiktet blokkering kan godt vise seg å være sann der. Det vil vi undersøke neste gang.
Og en robots.txt-fil registrerer intensjon, ikke håndhevelse. Vi testet ikke om disse domenene faktisk leverer innhold til hver enkelt agent, noe som er der CDN-reglene gjelder og der gapet mellom filen og virkeligheten ofte oppstår.
Plattformen bak denne studien finnes på honeyb.ai.

