Inledning
Varje artikel om AI-crawlers varnar dig för samma misstag. Du blockerade GPTBot under scraping-paniken 2023, lyder varningen, och du fångade av misstag de nyare agenterna som hämtar sidor för att citera i live-svar. Du menade att stoppa träningsscraparna och valde i tysthet bort att bli rekommenderad.
Vi har undersökt om detta verkligen sker.
På 219 domäner hände det noll gånger.
Inte sällan. Inte i ett fåtal fall. Inte en enda gång.
Metod
Vi tog de tjugo bästa organiska resultaten för 26 kommersiella sökfrågor inom sju kategorier: SaaS, e-handel, finans, hälsa, resor, hem och marknadsföring. Det gav 254 unika domäner. Vi hämtade robots.txt för var och en av dem den 28 juli 2026, och 219 kunde lösas. Sju av dessa hade ingen robots.txt alls, vilket räknas som att allt tillåts.
För varje domän jämförde vi varje AI-användaragent mot filen med hjälp av standardregeln för prioritet: den mest specifika matchande User-agent-gruppen vinner, så en exakt agentmatchning åsidosätter *. En domän räknas som att den blockerar en agent när dess vinnande grupp inte tillåter webbplatsens rotkatalog utan ett mer specifikt tillstånd.
Tolv agenter kontrollerades, uppdelade efter vad de matar in.
| Agent | Operatör | Flöden |
| GPTBot | OpenAI | utbildning |
| OAI-SearchBot | OpenAI | ChatGPT-sökcitat |
| ClaudeBot | Anthropic | träning |
| Claude-SearchBot | Anthropic | Claude-sökcitat |
| PerplexityBot | Perplexity | svar |
| DuckAssistBot | DuckDuckGo | svar |
| Amazonbot | Amazon | svar |
| CCBot | Common Crawl | ett korpus som många modeller utgår ifrån |
| Google-Extended | Gemini-träning, inte sökning | |
| Applebot-Extended | Apple | utbildning |
| Bytespider | ByteDance | utbildning |
| meta-extern agent | Meta | träning |
Resultat
77 % av dessa domäner tillåter alla AI-agenter. Tjugotre procent blockerar minst en.
| Agent | Blockerad | Domäner som uttryckligen nämner det |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Den agent som blockeras minst ofta är den som hämtar sidor som ChatGPT kan citera. De agenter som blockeras oftast är de som skrapar data för träningskorpusar.
Allt-i-ett-plattformen för effektiv SEO
Bakom varje framgångsrikt företag finns en stark SEO-kampanj. Men med otaliga optimeringsverktyg och tekniker att välja mellan kan det vara svårt att veta var man ska börja. Nåväl, frukta inte längre, för jag har precis det som kan hjälpa dig. Jag presenterar Ranktracker, en allt-i-ett-plattform för effektiv SEO.
Vi har äntligen öppnat registreringen av Ranktracker helt gratis!
Skapa ett kostnadsfritt kontoEller logga in med dina autentiseringsuppgifter
Denna ordning är ingen slump, och det är hela slutsatsen.
Ingen begår misstaget. Alla fattar ett beslut
Titta på de två operatörerna som driver både en träningscrawler och en sökcrawler.
| Blockerar båda | Blockerar träning, tillåter sökning | Blockerar sökning, tillåter träning | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 % |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Tolv domäner blockerar GPTBot samtidigt som de medvetet tillåter OAI-SearchBot. Femton gör motsvarande för Anthropic. Det är en konsekvent policy: träna inte på mitt innehåll, men citera gärna mig.
Ingen gör tvärtom.
Ytterligare två siffror pekar i samma riktning. Endast fyra domäner i hela urvalet använder ett generellt User-agent: * root-förbud, och exakt en blockerar en AI-agent utan att uttryckligen namnge någon AI-agent. Den som redigerar dessa filer vet vilka agenter som finns och vad var och en gör.
Branschvarningen tar alltså upp ett problem som, i detta urval, inte existerar. Den intressanta frågan är inte om du blockerade sökagenterna av misstag. Den är om du gjorde det med avsikt.
Eftersom 18 % av dessa domäner blockerar minst en sökagent och 4 % blockerar alla fyra. Dessa webbplatser har valt att inte visas i AI-svar, och utifrån dessa bevis gjorde de det medvetet.
De 5 sätten att åtgärda detta redan idag
-
Behandla träning och sökning som två separata frågor. Det är olika beslut och marknaden har redan skiljt dem åt. De flesta utgivare vill ha det andra utan det första. Skriv filen på det sättet istället för att behandla ”AI-crawlers” som en enda kategori.
-
Namnge varje agent uttryckligen. Endast fyra domäner här förlitar sig på jokertecknet, och det finns en god anledning till det: ett enkelt User-agent: * disallow fångar upp agenter som inte fanns när du skrev det, och kommer att fånga upp agenter som ännu inte finns. Två av de mest blockerade agenterna i dessa resultat, Bytespider och meta-externalagent, är nyare än de flesta av de råd om robots.txt som fortfarande cirkulerar.
-
Kontrollera OAI-SearchBot och Claude-SearchBot efter namn. Dessa två avgör om du kan citeras. Nio respektive tio procent av urvalet blockerar dem. Om du ingår i den gruppen utan att ha avsett det är det den här raden du ska ändra, och det är den enda punkten på listan som medför en omedelbar kostnad i form av synlighet.
-
Gör en ny granskning varje kvartal. Nya agenter har dykt upp flera gånger under det senaste året. En fil som skrevs för arton månader sedan saknar poster, oavsett hur noggrant den skrevs vid den tiden.
-
Kontrollera i utkanten, inte bara i filen. Regler för bot-hantering hos ditt CDN kan blockera en agent som robots.txt uttryckligen tillåter, och filen kommer inte att ge dig någon information om detta. Detta är det fel som överlever en perfekt robots.txt.
En utgångspunkt som skiljer de två besluten åt:
# Citerar mig. Dessa hämtar sidor för att citera i realtidssvar.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Möt RanktrackerAllt-i-ett-plattformen för effektiv SEO
Bakom varje framgångsrikt företag finns en stark SEO-kampanj. Men med otaliga optimeringsverktyg och tekniker att välja mellan kan det vara svårt att veta var man ska börja. Nåväl, frukta inte längre, för jag har precis det som kan hjälpa dig. Jag presenterar Ranktracker, en allt-i-ett-plattform för effektiv SEO.
Vi har äntligen öppnat registreringen av Ranktracker helt gratis!
Skapa ett kostnadsfritt kontoEller logga in med dina autentiseringsuppgifter
User-agent: DuckAssistBot
Allow: /
Träna inte på mig. Ändra dessa till Allow om du inte håller med.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Det ligger nära den konfiguration som tolv till femton domäner i detta urval redan använder. Det är numera en vanlig inställning snarare än en smart sådan.
Varför inget av detta syns i en rapport som du redan kör
Search Console rapporterar om Googlebot. Den nämner ingenting om OAI-SearchBot. Analytics rapporterar sessioner, och en sökmotor som aldrig indexerar din webbplats skickar inga sessioner som kan saknas. Rankningsverktyg rapporterar positioner, och dina positioner påverkas inte av något av detta.
Allt-i-ett-plattformen för effektiv SEO
Bakom varje framgångsrikt företag finns en stark SEO-kampanj. Men med otaliga optimeringsverktyg och tekniker att välja mellan kan det vara svårt att veta var man ska börja. Nåväl, frukta inte längre, för jag har precis det som kan hjälpa dig. Jag presenterar Ranktracker, en allt-i-ett-plattform för effektiv SEO.
Vi har äntligen öppnat registreringen av Ranktracker helt gratis!
Skapa ett kostnadsfritt kontoEller logga in med dina autentiseringsuppgifter
Det finns två sätt att upptäcka detta. Läs filen direkt, vilket är vad denna studie gjorde. Eller arbeta baklänges utifrån symptomet med ett AI-verktyg för synlighetskontroll, där du ställer frågor om din kategori till sökmotorerna enligt ett schema och håller utkik efter svaret som säger att de inte kan se dig alls.
Den crawlergranskning som ligger till grund för denna studie är den vi kör i Honeyb, där vi jämför varje namngiven agent i katalogen ovan mot en webbplats robotregler enligt ett schema snarare än som en engångsföreteelse. Åtkomst är den första av fyra saker som kontrolleras. De andra tre är om sökmotorerna rekommenderar dig, vad som specifikt behöver ändras, och sedan att producera och publicera det innehåll som åstadkommer förändringen.
Två begränsningar värda att nämna
Detta urval består av kommersiella SERP:er i USA, så det är snedfördelat mot stora publicister och etablerade varumärken, som både har medvetenheten och den juridiska rådgivningen för att fatta ett väl övervägt beslut här. Ett urval av småföretagswebbplatser skulle mycket troligt se annorlunda ut, och berättelsen om oavsiktlig blockering skulle mycket väl kunna visa sig stämma där. Det skulle vi köra nästa gång.
Och en robots.txt-fil dokumenterar avsikt, inte genomförande. Vi testade inte om dessa domäner faktiskt levererar innehåll till varje agent, vilket är där CDN-reglerna gäller och där klyftan mellan filen och verkligheten tenderar att uppstå.
Plattformen bakom denna studie finns på honeyb.ai.

