Úvod
Každý článek o AI crawlerech vás varuje před stejnou chybou. Varování zní: během paniky kolem scrapingu v roce 2023 jste zablokovali GPTBot a omylem jste tím zablokovali i novější agenty, kteří stahují stránky pro citace v živých odpovědích. Chtěli jste zastavit trénovací scrapery a tiše jste se odhlásili z doporučování.
Ověřili jsme, zda se to skutečně děje.
Na 219 doménách se to nestalo ani jednou.
Ne zřídka. Ne v několika případech. Ani jednou.
Metoda
Vzali jsme dvacet nejlepších organických výsledků pro 26 komerčních dotazů v sedmi kategoriích: SaaS, e-commerce, finance, zdraví, cestování, domácnost a marketing. To nám dalo 254 jedinečných domén. Dne 28. července 2026 jsme pro každou z nich načítali soubor robots.txt a u 219 se nám to podařilo. Sedm z nich soubor robots.txt vůbec neposkytovalo, což se počítá jako povolení všeho.
U každé domény jsme porovnali každý AI user agent s tímto souborem pomocí standardního pravidla priority: vyhrává nejkonkrétnější shodná skupina User-agent, takže přesná shoda agenta má přednost před *. Doména se považuje za blokující agenta, pokud její vítězná skupina zakazuje přístup ke kořenovému adresáři webu bez konkrétnějšího povolení.
Bylo zkontrolováno dvanáct agentů, rozdělených podle toho, co poskytují.
| Agent | Provozovatel | Zdroje |
| GPTBot | OpenAI | trénování |
| OAI-SearchBot | OpenAI | Citace z vyhledávání ChatGPT |
| ClaudeBot | Anthropic | trénování |
| Claude-SearchBot | Anthropic | Citace z vyhledávání Claude |
| PerplexityBot | Perplexity | odpovědi |
| DuckAssistBot | DuckDuckGo | odpovědi |
| Amazonbot | Amazon | odpovědi |
| CCBot | Common Crawl | korpus, z něhož čerpá mnoho modelů |
| Google-Extended | Gemini – trénink, nikoli vyhledávání | |
| Applebot-Extended | Apple | trénink |
| Bytespider | ByteDance | školení |
| meta-externalagent | Meta | trénink |
Výsledky
77 % těchto domén povoluje všechny AI agenty. Dvacet tři procent blokuje alespoň jednoho.
| Agent | Zablokováno | Domény, které jej explicitně uvádějí |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Agent, který je blokován nejméně často, je ten, který stahuje stránky pro ChatGPT k citování. Agenti, kteří jsou blokováni nejčastěji, jsou ti, kteří sbírají data pro trénovací korpusy.
Univerzální platforma pro efektivní SEO
Za každým úspěšným podnikem stojí silná kampaň SEO. Vzhledem k nesčetným optimalizačním nástrojům a technikám je však těžké zjistit, kde začít. No, už se nebojte, protože mám pro vás přesně to, co vám pomůže. Představuji vám komplexní platformu Ranktracker pro efektivní SEO.
Konečně jsme otevřeli registraci do nástroje Ranktracker zcela zdarma!
Vytvoření bezplatného účtuNebo se přihlaste pomocí svých přihlašovacích údajů
Toto pořadí není náhodné a představuje celý závěr.
Nikdo nedělá chybu. Každý se rozhoduje
Podívejte se na dva provozovatele, kteří provozují jak trénovací, tak vyhledávací crawler.
| Blokuje obojí | Blokuje trénování, umožňuje vyhledávání | Blokuje vyhledávání, umožňuje trénování | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 % |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Dvanáct domén blokuje GPTBot, zatímco záměrně povoluje OAI-SearchBot. Patnáct domén postupuje stejně v případě Anthropic. Jedná se o soudržnou politiku: neškolte se na mém obsahu, ale citujte mě.
Nikdo nedělá opak.
Další dvě čísla ukazují stejným směrem. Pouze čtyři domény v celém vzorku používají plošný zákaz User-agent: * root a přesně jedna blokuje AI agenta, aniž by výslovně jmenovala jakéhokoli AI agenta. Kdokoli tyto soubory upravuje, ví, které agenty existují a co každý z nich dělá.
Varování odvětví se tedy týká problému, který v tomto vzorku neexistuje. Zajímavou otázkou není, zda jste vyhledávací agenty zablokovali omylem. Jde o to, zda jste to udělali záměrně.
Protože 18 % těchto domén blokuje alespoň jednoho vyhledávacího agenta a 4 % blokují všechny čtyři. Tyto weby se rozhodly, že se nebudou zobrazovat v odpovědích AI, a podle těchto důkazů to udělaly záměrně.
5 způsobů, jak to dnes napravit
-
Považujte trénování a vyhledávání za dvě samostatné otázky. Jedná se o odlišná rozhodnutí a trh je již rozdělil. Většina vydavatelů chce to druhé bez toho prvního. Napište soubor tímto způsobem, místo abyste „AI crawlery“ považovali za jednu kategorii.
-
Každého agenta pojmenujte explicitně. Pouze čtyři domény zde spoléhají na zástupný znak, a to z dobrého důvodu: pouhé User-agent: * disallow zachytí agenty, kteří neexistovali v době, kdy jste to psali, a zachytí i agenty, kteří ještě neexistují. Dva z nejvíce blokovaných agentů v těchto výsledcích, Bytespider a meta-externalagent, jsou novější než většina rad ohledně souboru robots.txt, které stále kolují.
-
Zkontrolujte OAI-SearchBot a Claude-SearchBot podle názvu. Právě tito dva rozhodují o tom, zda můžete být citováni. Devět a deset procent vzorku je blokuje. Pokud patříte do této skupiny a neměli jste to v úmyslu, je to právě tento řádek, který je třeba změnit, a je to jediná položka na tomto seznamu, která má okamžitý dopad na viditelnost.
-
Provádějte kontrolu každé čtvrtletí. V uplynulém roce se několikrát objevili noví agenti. Soubor napsaný před osmnácti měsíci bude mít chybějící položky, bez ohledu na to, jak pečlivě byl tehdy sepsán.
-
Ověřujte na okraji sítě, nejen v souboru. Pravidla pro správu robotů ve vaší síti CDN mohou blokovat agenta, kterého soubor robots.txt výslovně povoluje, a soubor vám o tom nic neřekne. To je chyba, která přežije i dokonalý soubor robots.txt.
Výchozí bod, který rozlišuje mezi těmito dvěma rozhodnutími:
# Citujte mě. Tyto roboty načítávají stránky pro citace v živých odpovědích.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Seznamte se s nástrojem RanktrackerUniverzální platforma pro efektivní SEO
Za každým úspěšným podnikem stojí silná kampaň SEO. Vzhledem k nesčetným optimalizačním nástrojům a technikám je však těžké zjistit, kde začít. No, už se nebojte, protože mám pro vás přesně to, co vám pomůže. Představuji vám komplexní platformu Ranktracker pro efektivní SEO.
Konečně jsme otevřeli registraci do nástroje Ranktracker zcela zdarma!
Vytvoření bezplatného účtuNebo se přihlaste pomocí svých přihlašovacích údajů
User-agent: DuckAssistBot
Allow: /
Nepoužívejte mě k trénování. Pokud nesouhlasíte, změňte tyto položky na Allow.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
To se blíží konfiguraci, kterou již používá dvanáct až patnáct domén v tomto vzorku. V současné době se jedná spíše o běžný postup než o nějaký chytrý nápad.
Proč se nic z toho neobjevuje ve zprávách, které již sledujete
Search Console vykazuje Googlebot. O OAI-SearchBot se nezmiňuje. Analytics vykazuje relace a vyhledávač, který na vás nikdy neodkazuje, neposílá žádné relace, které by chyběly. Nástroje pro sledování pozic vykazují pozice a vaše pozice tím nejsou nijak ovlivněny.
Univerzální platforma pro efektivní SEO
Za každým úspěšným podnikem stojí silná kampaň SEO. Vzhledem k nesčetným optimalizačním nástrojům a technikám je však těžké zjistit, kde začít. No, už se nebojte, protože mám pro vás přesně to, co vám pomůže. Představuji vám komplexní platformu Ranktracker pro efektivní SEO.
Konečně jsme otevřeli registraci do nástroje Ranktracker zcela zdarma!
Vytvoření bezplatného účtuNebo se přihlaste pomocí svých přihlašovacích údajů
Existují dva způsoby, jak to odhalit. Přečíst si soubor přímo, což bylo provedeno v rámci této studie. Nebo postupovat zpětně od příznaku pomocí nástroje pro kontrolu viditelnosti s umělou inteligencí, který podle plánu klade vyhledávačům otázky týkající se vaší kategorie a sleduje, zda se neobjeví odpověď, že vás vůbec nevidí.
Audit prohledávačů, na kterém je tato studie založena, provádíme v Honeyb, kde porovnáváme každého jmenovaného agenta z výše uvedeného katalogu s pravidly robots.txt daného webu podle plánu, nikoli jednorázově. Přístup je první ze čtyř věcí, které kontroluje. Dalšími třemi jsou: zda vás vyhledávače doporučují, co konkrétně je třeba změnit a následně vytvoření a zveřejnění obsahu, který tyto změny zohlední.
Dvě omezení, která stojí za zmínku
Tento vzorek představuje komerční výsledky vyhledávání (SERP) v USA, takže je zkreslen ve prospěch velkých vydavatelů a zavedených značek, které disponují jak povědomím, tak právním poradenstvím, aby v této věci mohly učinit uvážené rozhodnutí. Vzorek webů malých podniků by s velkou pravděpodobností vypadal jinak a příběh o náhodném blokování by se tam mohl ukázat jako pravdivý. To bychom prověřili jako další.
A soubor robots.txt zaznamenává záměr, nikoli vynucení. Netestovali jsme, zda tyto domény skutečně poskytují obsah každému agentovi, což je oblast, kde platí pravidla CDN a kde se obvykle objevuje rozpor mezi obsahem souboru a realitou.
Platforma, na které tato studie běží, je honeyb.ai.

