• AI SEO

5 najlepších spôsobov, ako opraviť súbor robots.txt pre roboty umelej inteligencie – na základe kontroly 219 domén

  • Felix Rose-Collins
  • 4 min read

Úvod

Každý článok o AI crawleroch vás varuje pred tou istou chybou. Varovanie znie: počas paniky okolo scrapovania v roku 2023 ste zablokovali GPTBot a omylom ste zachytili aj novšie agenty, ktoré načítajú stránky na citovanie v živých odpovediach. Chceli ste zastaviť trénovacie scrapery a nenápadne ste sa odhlásili z odporúčaní.

Overili sme, či sa to skutočne deje.

Na 219 doménach sa to nestalo ani raz.

Nie zriedka. Nie v niekoľkých prípadoch. Ani raz.

Metóda

Vybrali sme dvadsať najlepších organických výsledkov pre 26 komerčných vyhľadávacích dotazov v siedmich kategóriách: SaaS, e-commerce, financie, zdravie, cestovanie, domácnosť a marketing. To nám poskytlo 254 jedinečných domén. Dňa 28. júla 2026 sme pre každú z nich načítali súbor robots.txt a 219 z nich sa podarilo vyriešiť. Sedem z nich neposkytovalo žiadny súbor robots.txt, čo sa považuje za povolenie všetkého.

Pre každú doménu sme porovnali každý AI užívateľský agent so súborom pomocou štandardného pravidla prednosti: vyhráva najšpecifickejšia zhodná skupina User-agent, takže presná zhoda agenta má prednosť pred *. Doména sa považuje za blokujúcu agenta, ak jej víťazná skupina nepovoľuje koreňovú zložku webu bez špecifickejšieho povolenia.

Bolo skontrolovaných dvanásť agentov, rozdelených podľa toho, čo poskytujú.

Agent Operátor Kanály
GPTBot OpenAI tréning
OAI-SearchBot OpenAI Citácie vyhľadávania ChatGPT
ClaudeBot Anthropic tréning
Claude-SearchBot Anthropic Citácie vyhľadávania Claude
PerplexityBot Perplexity odpovede
DuckAssistBot DuckDuckGo odpovede
Amazonbot Amazon odpovede
CCBot Common Crawl korpus, z ktorého čerpá mnoho modelov
Google-Extended Google Gemini – trénovanie, nie vyhľadávanie
Applebot-Extended Apple tréning
Bytespider ByteDance školenie
meta-externý agent Meta tréning

Výsledky

77 % týchto domén povoľuje všetky AI agenty. Dvadsaťtri percent blokuje aspoň jeden.

Agent Zablokované Domény, ktoré ho explicitne uvádzajú
Bytespider 20 % 45
CCBot 20 % 47
ClaudeBot 17 % 50
Google-Extended 16 % 46
meta-externalagent 16 % 38
PerplexityBot 15 % 44
GPTBot 14 % 53
Applebot-Extended 14 % 39
Amazonbot 13 % 39
Claude-SearchBot 10 % 22
DuckAssistBot 10 % 24
OAI-SearchBot 9 % 34

Agent, ktorý bol blokovaný najmenej často, je ten, ktorý načíta stránky pre ChatGPT na citovanie. Agenti, ktorí boli blokovaní najčastejšie, sú tí, ktorí zbierajú dáta pre trénovacie korpusy.

Zoznámte sa s nástrojom Ranktracker

Platforma "všetko v jednom" pre efektívne SEO

Za každým úspešným podnikaním stojí silná kampaň SEO. Pri nespočetnom množstve optimalizačných nástrojov a techník, z ktorých si môžete vybrať, však môže byť ťažké zistiť, kde začať. No už sa nemusíte báť, pretože mám pre vás presne to, čo vám pomôže. Predstavujem komplexnú platformu Ranktracker na efektívne SEO

Konečne sme otvorili registráciu do nástroja Ranktracker úplne zadarmo!

Vytvorenie bezplatného konta

Alebo sa pri hláste pomocou svojich poverení

Toto poradie nie je náhodné a predstavuje celý záver.

Nikto nerobí chybu. Každý sa rozhoduje

Pozrime sa na dvoch prevádzkovateľov, ktorí prevádzkujú aj vyhľadávací, aj trénovací robot.

Blokuje oboje Blokuje trénovanie, umožňuje vyhľadávanie Blokuje vyhľadávanie, umožňuje trénovanie
OpenAI, GPTBot / OAI-SearchBot 9 % 5 % 0
Anthropic, ClaudeBot / Claude-SearchBot 10 % 7 % 0

Dvanásť domén blokuje GPTBot, zatiaľ čo zámerne povoľujú OAI-SearchBot. Pätnásť robí to isté v prípade Anthropic. Ide o koherentnú politiku: neškolte sa na mojom obsahu, ale citujte ma.

Nikto nerobí opak.

Ďalšie dve čísla poukazujú na to isté. Len štyri domény v celej vzorke používajú paušálny zákaz User-agent: * root a presne jedna blokuje agenta umelej inteligencie bez toho, aby explicitne menovala akéhokoľvek agenta umelej inteligencie. Ktokoľvek upravuje tieto súbory, vie, ktoré agenty existujú a čo každý z nich robí.

Varovanie odvetvia sa teda týka problému, ktorý v tejto vzorke neexistuje. Zaujímavá otázka nie je, či ste vyhľadávacie roboty zablokovali náhodou. Je to otázka, či ste to urobili zámerne.

Pretože 18 % týchto domén blokuje aspoň jedného vyhľadávacieho agenta a 4 % blokuje všetkých štyroch. Tieto stránky sa rozhodli, že sa nebudú zobrazovať v odpovediach umelej inteligencie, a na základe týchto dôkazov to urobili zámerne.

5 spôsobov, ako to dnes napraviť

  1. Považujte trénovanie a vyhľadávanie za dve samostatné otázky. Ide o odlišné rozhodnutia a trh ich už rozdelil. Väčšina vydavateľov chce to druhé bez toho prvého. Napíšte súbor týmto spôsobom, namiesto toho, aby ste „AI crawlery“ považovali za jednu kategóriu.

  2. Každého agenta explicitne pomenujte. Len štyri domény tu využívajú zástupný znak, a to z dobrého dôvodu: holý príkaz User-agent: * disallow zachytáva agentov, ktorí neexistovali v čase, keď ste ho písali, a zachytí aj agentov, ktorí ešte neexistujú. Dvaja z najčastejšie blokovaných agentov v týchto výsledkoch, Bytespider a meta-externalagent, sú novší ako väčšina rád týkajúcich sa súboru robots.txt, ktoré stále kolujú.

  3. Skontrolujte OAI-SearchBot a Claude-SearchBot podľa názvu. Tieto dva rozhodujú o tom, či vás môžu citovať. Deväť a desať percent vzorky ich blokuje. Ak patríte do tejto skupiny a nemali ste to v úmysle, práve tento riadok je potrebné zmeniť a je to jediná položka na tomto zozname, ktorá má okamžitý vplyv na viditeľnosť.

  4. Audit opakujte štvrťročne. V uplynulom roku sa niekoľkokrát objavili nové roboty. V súbore napísanom pred osemnástimi mesiacmi chýbajú záznamy bez ohľadu na to, ako starostlivo bol v tom čase napísaný.

  5. Overujte na okraji, nielen v súbore. Pravidlá správy robotov vo vašej CDN môžu blokovať agenta, ktorého súbor robots.txt výslovne povoľuje, a súbor vám o tom nič nepovie. Toto je chyba, ktorá pretrváva aj pri dokonalom súbore robots.txt.

Východiskový bod, ktorý oddeľuje tieto dve rozhodnutia:

# Citujte ma. Tieto roboty načítajú stránky na citovanie v živých odpovediach.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Zoznámte sa s nástrojom Ranktracker

Platforma "všetko v jednom" pre efektívne SEO

Za každým úspešným podnikaním stojí silná kampaň SEO. Pri nespočetnom množstve optimalizačných nástrojov a techník, z ktorých si môžete vybrať, však môže byť ťažké zistiť, kde začať. No už sa nemusíte báť, pretože mám pre vás presne to, čo vám pomôže. Predstavujem komplexnú platformu Ranktracker na efektívne SEO

Konečne sme otvorili registráciu do nástroja Ranktracker úplne zadarmo!

Vytvorenie bezplatného konta

Alebo sa pri hláste pomocou svojich poverení

User-agent: DuckAssistBot Allow: /

Netrénujte na mne. Ak nesúhlasíte, zmeňte tieto nastavenia na „Allow“.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Toto sa blíži konfigurácii, ktorú už používa dvanásť až pätnásť domén v tomto vzorke. V súčasnosti ide skôr o bežný prístup než o nejaký dômyselný.

Prečo sa nič z toho neobjavuje v správe, ktorú už spúšťate

Search Console vykazuje Googlebot. O OAI-SearchBot sa nezmieňuje. Analytics vykazuje relácie a vyhľadávač, ktorý vás nikdy necituje, neposiela žiadne relácie, ktoré by chýbali. Nástroje na sledovanie pozícií vykazujú pozície a vaše pozície týmto nie sú ovplyvnené.

Zoznámte sa s nástrojom Ranktracker

Platforma "všetko v jednom" pre efektívne SEO

Za každým úspešným podnikaním stojí silná kampaň SEO. Pri nespočetnom množstve optimalizačných nástrojov a techník, z ktorých si môžete vybrať, však môže byť ťažké zistiť, kde začať. No už sa nemusíte báť, pretože mám pre vás presne to, čo vám pomôže. Predstavujem komplexnú platformu Ranktracker na efektívne SEO

Konečne sme otvorili registráciu do nástroja Ranktracker úplne zadarmo!

Vytvorenie bezplatného konta

Alebo sa pri hláste pomocou svojich poverení

Existujú dva spôsoby, ako to odhaliť. Prečítať si súbor priamo, čo sa stalo v rámci tejto štúdie. Alebo postupovať spätne od symptómu pomocou nástroja na kontrolu viditeľnosti s umelou inteligenciou, ktorý vyhľadávačom kladie otázky týkajúce sa vašej kategórie podľa plánu a sleduje odpoveď, ktorá hovorí, že vás vôbec nevidí.

Audit prehliadača, na ktorom je táto štúdia založená, je ten, ktorý vykonávame v Honeyb, pričom porovnávame každého menovaného agenta z vyššie uvedeného zoznamu s pravidlami súboru robots.txt danej stránky podľa plánu, a nie jednorazovo. Prístup je prvou zo štyroch vecí, ktoré kontroluje. Ďalšie tri sú: či vás vyhľadávače odporúčajú, čo konkrétne je potrebné zmeniť a následne vytvorenie a zverejnenie obsahu, ktorý tieto zmeny zohľadňuje.

Dve obmedzenia, ktoré stojí za zmienku

Táto vzorka pochádza z komerčných výsledkov vyhľadávania v USA, takže je skreslená v prospech veľkých vydavateľov a etablovaných značiek, ktoré disponujú dostatočnou informovanosťou aj právnym poradenstvom na to, aby v tejto veci mohli prijať premyslené rozhodnutie. Vzorka webových stránok malých podnikov by s veľkou pravdepodobnosťou vyzerala inak a príbeh o náhodnom blokovaní by sa tam mohol ukázať ako pravdivý. To by sme otestovali ako ďalšie.

A súbor robots.txt zaznamenáva zámer, nie vynútiteľnosť. Netestovali sme, či tieto domény skutočne poskytujú obsah každému agentovi, čo je oblasť, kde platia pravidlá CDN a kde sa zvyčajne prejavuje rozdiel medzi súborom a realitou.

Platforma, na ktorej táto štúdia stojí, sa nachádza na adrese honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Začnite používať Ranktracker... zadarmo!

Zistite, čo brzdí vaše webové stránky v hodnotení.

Vytvorenie bezplatného konta

Alebo sa pri hláste pomocou svojich poverení

Different views of Ranktracker app