Uvod
Vsak članek o iskalnikih z umetno inteligenco vas opozarja na isto napako. V paniki zaradi izpisovanja podatkov leta 2023 ste blokirali GPTBot, pravi opozorilo, in po nesreči ste zajeli tudi novejše agente, ki pridobivajo strani za navajanje v odgovorih v realnem času. Vaš namen je bil ustaviti iskalnike za usposabljanje, s tem pa ste se tiho odjavili iz sistema priporočil.
Preverili smo, ali se to dejansko dogaja.
Na 219 domenah se to ni zgodilo niti enkrat.
Ne redko. Ne v peščici primerov. Niti enkrat.
Metoda
Vzeli smo prvih dvajset organskih rezultatov za 26 komercialnih poizvedb v sedmih kategorijah: SaaS, e-trgovina, finance, zdravje, potovanja, dom in marketing. To je dalo 254 edinstvenih domen. 28. julija 2026 smo za vsako od njih pridobili datoteko robots.txt, od katerih je bilo 219 uspešno razrešenih. Sedem od teh sploh ni imelo datoteke robots.txt, kar šteje kot dovoljenje za vse.
Za vsako domeno smo preverili vsak AI uporabniški agent glede na datoteko z uporabo standardnega pravila prednosti: zmaga najbolj specifična ujemajoča se skupina User-agent, torej natančno ujemanje agenta prevlada nad *. Domena se šteje kot takšna, ki blokira agenta, če njena zmagovalna skupina prepoveduje dostop do korenskega imenika spletnega mesta brez bolj specifičnega dovoljenja.
Preverjenih je bilo dvanajst agentov, razvrščenih glede na to, kaj objavljajo.
| Agent | Operater | Viri |
| GPTBot | OpenAI | usposabljanje |
| OAI-SearchBot | OpenAI | Iskanje citatov v ChatGPT |
| ClaudeBot | Anthropic | usposabljanje |
| Claude-SearchBot | Anthropic | Claude iskanje citatov |
| PerplexityBot | Perplexity | odgovori |
| DuckAssistBot | DuckDuckGo | odgovori |
| Amazonbot | Amazon | odgovori |
| CCBot | Common Crawl | korpus, na katerem temelji veliko modelov |
| Google-Extended | usposabljanje Gemini, ne iskanje | |
| Applebot-Extended | Apple | usposabljanje |
| Bytespider | ByteDance | usposabljanje |
| meta-zunanji agent | Meta | usposabljanje |
Rezultati
77 % teh domen dovoli vsakega AI-agenta. Dvaindvajset odstotkov jih blokira vsaj enega.
| Agent | Blokiran | Domene, ki ga izrecno imenujejo |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-zunanji agent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Agent, ki je bil najredkeje blokiran, je tisti, ki pridobiva strani, ki jih ChatGPT navaja. Najpogosteje blokirani agenti so tisti, ki zbirajo podatke za korpuse za usposabljanje.
Platforma "vse v enem" za učinkovito SEO
Za vsakim uspešnim podjetjem stoji močna kampanja SEO. Vendar je ob neštetih orodjih in tehnikah optimizacije težko vedeti, kje začeti. Ne bojte se več, ker imam za vas prav to, kar vam lahko pomaga. Predstavljam platformo Ranktracker vse-v-enem za učinkovito SEO
Končno smo odprli registracijo za Ranktracker popolnoma brezplačno!
Ustvarite brezplačen računAli se prijavite s svojimi poverilnicami
Ta vrstni red ni naključen in predstavlja celotno ugotovitev.
Nihče ne dela napake. Vsi sprejemajo odločitev
Poglejte dva operaterja, ki upravljata tako iskalni kot tudi spletni pajek za usposabljanje.
| Blokira oboje | Blokira usposabljanje, omogoča iskanje | Blokira iskanje, omogoča usposabljanje | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Dvanajst domen blokira GPTBot, medtem ko namerno dovoljuje OAI-SearchBot. Petnajst domen ravna enako v primeru Anthropic. To je dosledna politika: ne usposabljajte se na moji vsebini, vendar me lahko navajate.
Nihče ne počne nasprotnega.
Še dve številki kažejo v isto smer. Le štiri domene v celotnem vzorcu uporabljajo splošno prepoved User-agent: * root, in natanko ena blokira AI-agenta, ne da bi izrecno imenovala katerega koli AI-agenta. Kdor koli ureja te datoteke, ve, kateri agenti obstajajo in kaj vsak od njih počne.
Tako opozorilo industrije obravnava problem, ki v tem vzorcu ne obstaja. Zanimivo vprašanje ni, ali ste iskalne agente blokirali po nesreči. Je, ali ste to storili namerno.
Ker 18 % teh domen blokira vsaj enega iskalnega agenta, 4 % pa vse štiri. Te spletne strani so se odločile, da ne bodo prikazane v odgovorih umetne inteligence, in glede na te dokaze so to storile namerno.
5 načinov, kako lahko danes popravite svoje
-
Obravnavajte usposabljanje in iskanje kot dve ločeni zadevi. Gre za različne odločitve, trg pa ju je že ločil. Večina založnikov želi drugo brez prvega. Datoteko napišite na ta način, namesto da „AI-pajke“ obravnavate kot eno kategorijo.
-
Vsakega agenta izrecno poimenujte. Le štiri domene tukaj se zanašajo na nadomestni znak (*), in to z dobrim razlogom: golo User-agent: * disallow zajame agente, ki ob pisanju še niso obstajali, in bo zajelo agente, ki še ne obstajajo. Dva od najbolj blokiranih agentov v teh rezultatih, Bytespider in meta-externalagent, sta mlajša od večine nasvetov o datoteki robots.txt, ki še vedno krožijo.
-
Preverite OAI-SearchBot in Claude-SearchBot po imenu. Ti dva odločata, ali vas je mogoče citirati. Devet in deset odstotkov vzorca ju blokira. Če ste v tej skupini, čeprav tega niste nameravali, je to vrstica, ki jo morate spremeniti, in je edina točka na tem seznamu, ki ima takojšen vpliv na vidnost.
-
Ponovno preverite vsako četrtletje. V preteklem letu so se večkrat pojavili novi agenti. Datoteki, napisani pred osemnajstimi meseci, manjkajo vnosi, ne glede na to, kako skrbno je bila takrat napisana.
-
Preverite na robu, ne le v datoteki. Pravila za upravljanje botov v vašem CDN-ju lahko blokirajo agenta, ki ga robots.txt izrecno dovoljuje, datoteka pa vam o tem ne bo ničesar povedala. To je napaka, ki preživi tudi popoln robots.txt.
Izhodišče, ki ločuje ti dve odločitvi:
# Navajajte me. Ti roboti pridobivajo strani za citiranje v odgovorih v realnem času.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Spoznajte RanktrackerPlatforma "vse v enem" za učinkovito SEO
Za vsakim uspešnim podjetjem stoji močna kampanja SEO. Vendar je ob neštetih orodjih in tehnikah optimizacije težko vedeti, kje začeti. Ne bojte se več, ker imam za vas prav to, kar vam lahko pomaga. Predstavljam platformo Ranktracker vse-v-enem za učinkovito SEO
Končno smo odprli registracijo za Ranktracker popolnoma brezplačno!
Ustvarite brezplačen računAli se prijavite s svojimi poverilnicami
User-agent: DuckAssistBot
Allow: /
Ne uporabljajte me za učenje. Če se s tem ne strinjate, te nastavitve spremenite na »Allow«.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
To je podobno konfiguraciji, ki jo že uporablja dvanajst do petnajst domen v tem vzorcu. Danes to ni več le domiselna rešitev, ampak prevladujoče stališče.
Zakaj se nič od tega ne prikaže v poročilu, ki ga že uporabljate
Search Console poroča o Googlebotu. O OAI-SearchBotu ne poroča ničesar. Analytics poroča o sejah, in iskalnik, ki vas nikoli ne navaja, ne pošilja nobenih sej, ki bi manjkale. Sledilniki uvrstitve poročajo o uvrstitvah, na vaše uvrstitve pa nič od tega ne vpliva.
Platforma "vse v enem" za učinkovito SEO
Za vsakim uspešnim podjetjem stoji močna kampanja SEO. Vendar je ob neštetih orodjih in tehnikah optimizacije težko vedeti, kje začeti. Ne bojte se več, ker imam za vas prav to, kar vam lahko pomaga. Predstavljam platformo Ranktracker vse-v-enem za učinkovito SEO
Končno smo odprli registracijo za Ranktracker popolnoma brezplačno!
Ustvarite brezplačen računAli se prijavite s svojimi poverilnicami
To lahko ugotovite na dva načina. Preberite datoteko neposredno, kar je storila ta študija. Ali pa delajte nazaj od simptoma z AI-preverjalnikom vidnosti, tako da iskalnikom po urniku postavljate vprašanja o vaši kategoriji in čakate na odgovor, ki pravi, da vas sploh ne vidijo.
Revizija iskalnih robotov, na kateri temelji ta študija, je tista, ki jo izvajamo v Honeyb, pri čemer vsakega imenovanega agenta iz zgornjega kataloga primerjamo s pravili za robote spletnega mesta po urniku, ne pa enkratno. Dostop je prva od štirih stvari, ki jih preverja. Druge tri so, ali vas iskalniki priporočajo, kaj konkretno je treba spremeniti ter nato priprava in objava vsebine, ki to spremeni.
Dve omejitvi, ki ju je vredno omeniti
Ta vzorec zajema ameriške komercialne strani z rezultati iskanja (SERP), zato je usmerjen k velikim založnikom in uveljavljenim blagovnim znamkam, ki imajo tako zavest kot pravno svetovanje, da lahko v tem primeru sprejmejo premišljeno odločitev. Vzorec spletnih mest malih podjetij bi zelo verjetno izgledal drugače, in zgodba o naključnem blokiranju bi se tam lahko izkazala za resnično. To bomo preverili v naslednjem koraku.
Datoteka robots.txt pa beleži namero, ne pa izvrševanja. Nismo preverili, ali te domene dejansko prenašajo vsebino vsakemu agentu, kar je področje, kjer veljajo pravila CDN-ja in kjer se pogosto pojavi vrzel med datoteko in dejanskimi razmerami.
Platforma, na kateri temelji ta študija, je na naslovu honeyb.ai.

