Úvod
Každý článok o AI crawleroch vás varuje pred tou istou chybou. Varovanie znie: počas paniky okolo scrapovania v roku 2023 ste zablokovali GPTBot a omylom ste zachytili aj novšie agenty, ktoré načítajú stránky na citovanie v živých odpovediach. Chceli ste zastaviť trénovacie scrapery a nenápadne ste sa odhlásili z odporúčaní.
Overili sme, či sa to skutočne deje.
Na 219 doménach sa to nestalo ani raz.
Nie zriedka. Nie v niekoľkých prípadoch. Ani raz.
Metóda
Vybrali sme dvadsať najlepších organických výsledkov pre 26 komerčných vyhľadávacích dotazov v siedmich kategóriách: SaaS, e-commerce, financie, zdravie, cestovanie, domácnosť a marketing. To nám poskytlo 254 jedinečných domén. Dňa 28. júla 2026 sme pre každú z nich načítali súbor robots.txt a 219 z nich sa podarilo vyriešiť. Sedem z nich neposkytovalo žiadny súbor robots.txt, čo sa považuje za povolenie všetkého.
Pre každú doménu sme porovnali každý AI užívateľský agent so súborom pomocou štandardného pravidla prednosti: vyhráva najšpecifickejšia zhodná skupina User-agent, takže presná zhoda agenta má prednosť pred *. Doména sa považuje za blokujúcu agenta, ak jej víťazná skupina nepovoľuje koreňovú zložku webu bez špecifickejšieho povolenia.
Bolo skontrolovaných dvanásť agentov, rozdelených podľa toho, čo poskytujú.
| Agent | Operátor | Kanály |
| GPTBot | OpenAI | tréning |
| OAI-SearchBot | OpenAI | Citácie vyhľadávania ChatGPT |
| ClaudeBot | Anthropic | tréning |
| Claude-SearchBot | Anthropic | Citácie vyhľadávania Claude |
| PerplexityBot | Perplexity | odpovede |
| DuckAssistBot | DuckDuckGo | odpovede |
| Amazonbot | Amazon | odpovede |
| CCBot | Common Crawl | korpus, z ktorého čerpá mnoho modelov |
| Google-Extended | Gemini – trénovanie, nie vyhľadávanie | |
| Applebot-Extended | Apple | tréning |
| Bytespider | ByteDance | školenie |
| meta-externý agent | Meta | tréning |
Výsledky
77 % týchto domén povoľuje všetky AI agenty. Dvadsaťtri percent blokuje aspoň jeden.
| Agent | Zablokované | Domény, ktoré ho explicitne uvádzajú |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Agent, ktorý bol blokovaný najmenej často, je ten, ktorý načíta stránky pre ChatGPT na citovanie. Agenti, ktorí boli blokovaní najčastejšie, sú tí, ktorí zbierajú dáta pre trénovacie korpusy.
Platforma "všetko v jednom" pre efektívne SEO
Za každým úspešným podnikaním stojí silná kampaň SEO. Pri nespočetnom množstve optimalizačných nástrojov a techník, z ktorých si môžete vybrať, však môže byť ťažké zistiť, kde začať. No už sa nemusíte báť, pretože mám pre vás presne to, čo vám pomôže. Predstavujem komplexnú platformu Ranktracker na efektívne SEO
Konečne sme otvorili registráciu do nástroja Ranktracker úplne zadarmo!
Vytvorenie bezplatného kontaAlebo sa pri hláste pomocou svojich poverení
Toto poradie nie je náhodné a predstavuje celý záver.
Nikto nerobí chybu. Každý sa rozhoduje
Pozrime sa na dvoch prevádzkovateľov, ktorí prevádzkujú aj vyhľadávací, aj trénovací robot.
| Blokuje oboje | Blokuje trénovanie, umožňuje vyhľadávanie | Blokuje vyhľadávanie, umožňuje trénovanie | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Dvanásť domén blokuje GPTBot, zatiaľ čo zámerne povoľujú OAI-SearchBot. Pätnásť robí to isté v prípade Anthropic. Ide o koherentnú politiku: neškolte sa na mojom obsahu, ale citujte ma.
Nikto nerobí opak.
Ďalšie dve čísla poukazujú na to isté. Len štyri domény v celej vzorke používajú paušálny zákaz User-agent: * root a presne jedna blokuje agenta umelej inteligencie bez toho, aby explicitne menovala akéhokoľvek agenta umelej inteligencie. Ktokoľvek upravuje tieto súbory, vie, ktoré agenty existujú a čo každý z nich robí.
Varovanie odvetvia sa teda týka problému, ktorý v tejto vzorke neexistuje. Zaujímavá otázka nie je, či ste vyhľadávacie roboty zablokovali náhodou. Je to otázka, či ste to urobili zámerne.
Pretože 18 % týchto domén blokuje aspoň jedného vyhľadávacieho agenta a 4 % blokuje všetkých štyroch. Tieto stránky sa rozhodli, že sa nebudú zobrazovať v odpovediach umelej inteligencie, a na základe týchto dôkazov to urobili zámerne.
5 spôsobov, ako to dnes napraviť
-
Považujte trénovanie a vyhľadávanie za dve samostatné otázky. Ide o odlišné rozhodnutia a trh ich už rozdelil. Väčšina vydavateľov chce to druhé bez toho prvého. Napíšte súbor týmto spôsobom, namiesto toho, aby ste „AI crawlery“ považovali za jednu kategóriu.
-
Každého agenta explicitne pomenujte. Len štyri domény tu využívajú zástupný znak, a to z dobrého dôvodu: holý príkaz User-agent: * disallow zachytáva agentov, ktorí neexistovali v čase, keď ste ho písali, a zachytí aj agentov, ktorí ešte neexistujú. Dvaja z najčastejšie blokovaných agentov v týchto výsledkoch, Bytespider a meta-externalagent, sú novší ako väčšina rád týkajúcich sa súboru robots.txt, ktoré stále kolujú.
-
Skontrolujte OAI-SearchBot a Claude-SearchBot podľa názvu. Tieto dva rozhodujú o tom, či vás môžu citovať. Deväť a desať percent vzorky ich blokuje. Ak patríte do tejto skupiny a nemali ste to v úmysle, práve tento riadok je potrebné zmeniť a je to jediná položka na tomto zozname, ktorá má okamžitý vplyv na viditeľnosť.
-
Audit opakujte štvrťročne. V uplynulom roku sa niekoľkokrát objavili nové roboty. V súbore napísanom pred osemnástimi mesiacmi chýbajú záznamy bez ohľadu na to, ako starostlivo bol v tom čase napísaný.
-
Overujte na okraji, nielen v súbore. Pravidlá správy robotov vo vašej CDN môžu blokovať agenta, ktorého súbor robots.txt výslovne povoľuje, a súbor vám o tom nič nepovie. Toto je chyba, ktorá pretrváva aj pri dokonalom súbore robots.txt.
Východiskový bod, ktorý oddeľuje tieto dve rozhodnutia:
# Citujte ma. Tieto roboty načítajú stránky na citovanie v živých odpovediach.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Zoznámte sa s nástrojom RanktrackerPlatforma "všetko v jednom" pre efektívne SEO
Za každým úspešným podnikaním stojí silná kampaň SEO. Pri nespočetnom množstve optimalizačných nástrojov a techník, z ktorých si môžete vybrať, však môže byť ťažké zistiť, kde začať. No už sa nemusíte báť, pretože mám pre vás presne to, čo vám pomôže. Predstavujem komplexnú platformu Ranktracker na efektívne SEO
Konečne sme otvorili registráciu do nástroja Ranktracker úplne zadarmo!
Vytvorenie bezplatného kontaAlebo sa pri hláste pomocou svojich poverení
User-agent: DuckAssistBot
Allow: /
Netrénujte na mne. Ak nesúhlasíte, zmeňte tieto nastavenia na „Allow“.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Toto sa blíži konfigurácii, ktorú už používa dvanásť až pätnásť domén v tomto vzorke. V súčasnosti ide skôr o bežný prístup než o nejaký dômyselný.
Prečo sa nič z toho neobjavuje v správe, ktorú už spúšťate
Search Console vykazuje Googlebot. O OAI-SearchBot sa nezmieňuje. Analytics vykazuje relácie a vyhľadávač, ktorý vás nikdy necituje, neposiela žiadne relácie, ktoré by chýbali. Nástroje na sledovanie pozícií vykazujú pozície a vaše pozície týmto nie sú ovplyvnené.
Platforma "všetko v jednom" pre efektívne SEO
Za každým úspešným podnikaním stojí silná kampaň SEO. Pri nespočetnom množstve optimalizačných nástrojov a techník, z ktorých si môžete vybrať, však môže byť ťažké zistiť, kde začať. No už sa nemusíte báť, pretože mám pre vás presne to, čo vám pomôže. Predstavujem komplexnú platformu Ranktracker na efektívne SEO
Konečne sme otvorili registráciu do nástroja Ranktracker úplne zadarmo!
Vytvorenie bezplatného kontaAlebo sa pri hláste pomocou svojich poverení
Existujú dva spôsoby, ako to odhaliť. Prečítať si súbor priamo, čo sa stalo v rámci tejto štúdie. Alebo postupovať spätne od symptómu pomocou nástroja na kontrolu viditeľnosti s umelou inteligenciou, ktorý vyhľadávačom kladie otázky týkajúce sa vašej kategórie podľa plánu a sleduje odpoveď, ktorá hovorí, že vás vôbec nevidí.
Audit prehliadača, na ktorom je táto štúdia založená, je ten, ktorý vykonávame v Honeyb, pričom porovnávame každého menovaného agenta z vyššie uvedeného zoznamu s pravidlami súboru robots.txt danej stránky podľa plánu, a nie jednorazovo. Prístup je prvou zo štyroch vecí, ktoré kontroluje. Ďalšie tri sú: či vás vyhľadávače odporúčajú, čo konkrétne je potrebné zmeniť a následne vytvorenie a zverejnenie obsahu, ktorý tieto zmeny zohľadňuje.
Dve obmedzenia, ktoré stojí za zmienku
Táto vzorka pochádza z komerčných výsledkov vyhľadávania v USA, takže je skreslená v prospech veľkých vydavateľov a etablovaných značiek, ktoré disponujú dostatočnou informovanosťou aj právnym poradenstvom na to, aby v tejto veci mohli prijať premyslené rozhodnutie. Vzorka webových stránok malých podnikov by s veľkou pravdepodobnosťou vyzerala inak a príbeh o náhodnom blokovaní by sa tam mohol ukázať ako pravdivý. To by sme otestovali ako ďalšie.
A súbor robots.txt zaznamenáva zámer, nie vynútiteľnosť. Netestovali sme, či tieto domény skutočne poskytujú obsah každému agentovi, čo je oblasť, kde platia pravidlá CDN a kde sa zvyčajne prejavuje rozdiel medzi súborom a realitou.
Platforma, na ktorej táto štúdia stojí, sa nachádza na adrese honeyb.ai.

