• AI SEO

5 nejlepších způsobů, jak opravit soubor robots.txt pro AI-prohledávače – na základě prověření 219 domén

  • Felix Rose-Collins
  • 4 min read

Úvod

Každý článek o AI crawlerech vás varuje před stejnou chybou. Varování zní: během paniky kolem scrapingu v roce 2023 jste zablokovali GPTBot a omylem jste tím zablokovali i novější agenty, kteří stahují stránky pro citace v živých odpovědích. Chtěli jste zastavit trénovací scrapery a tiše jste se odhlásili z doporučování.

Ověřili jsme, zda se to skutečně děje.

Na 219 doménách se to nestalo ani jednou.

Ne zřídka. Ne v několika případech. Ani jednou.

Metoda

Vzali jsme dvacet nejlepších organických výsledků pro 26 komerčních dotazů v sedmi kategoriích: SaaS, e-commerce, finance, zdraví, cestování, domácnost a marketing. To nám dalo 254 jedinečných domén. Dne 28. července 2026 jsme pro každou z nich načítali soubor robots.txt a u 219 se nám to podařilo. Sedm z nich soubor robots.txt vůbec neposkytovalo, což se počítá jako povolení všeho.

U každé domény jsme porovnali každý AI user agent s tímto souborem pomocí standardního pravidla priority: vyhrává nejkonkrétnější shodná skupina User-agent, takže přesná shoda agenta má přednost před *. Doména se považuje za blokující agenta, pokud její vítězná skupina zakazuje přístup ke kořenovému adresáři webu bez konkrétnějšího povolení.

Bylo zkontrolováno dvanáct agentů, rozdělených podle toho, co poskytují.

Agent Provozovatel Zdroje
GPTBot OpenAI trénování
OAI-SearchBot OpenAI Citace z vyhledávání ChatGPT
ClaudeBot Anthropic trénování
Claude-SearchBot Anthropic Citace z vyhledávání Claude
PerplexityBot Perplexity odpovědi
DuckAssistBot DuckDuckGo odpovědi
Amazonbot Amazon odpovědi
CCBot Common Crawl korpus, z něhož čerpá mnoho modelů
Google-Extended Google Gemini – trénink, nikoli vyhledávání
Applebot-Extended Apple trénink
Bytespider ByteDance školení
meta-externalagent Meta trénink

Výsledky

77 % těchto domén povoluje všechny AI agenty. Dvacet tři procent blokuje alespoň jednoho.

Agent Zablokováno Domény, které jej explicitně uvádějí
Bytespider 20 % 45
CCBot 20 % 47
ClaudeBot 17 % 50
Google-Extended 16 % 46
meta-externalagent 16 % 38
PerplexityBot 15 % 44
GPTBot 14 % 53
Applebot-Extended 14 % 39
Amazonbot 13 % 39
Claude-SearchBot 10 % 22
DuckAssistBot 10 % 24
OAI-SearchBot 9 % 34

Agent, který je blokován nejméně často, je ten, který stahuje stránky pro ChatGPT k citování. Agenti, kteří jsou blokováni nejčastěji, jsou ti, kteří sbírají data pro trénovací korpusy.

Seznamte se s nástrojem Ranktracker

Univerzální platforma pro efektivní SEO

Za každým úspěšným podnikem stojí silná kampaň SEO. Vzhledem k nesčetným optimalizačním nástrojům a technikám je však těžké zjistit, kde začít. No, už se nebojte, protože mám pro vás přesně to, co vám pomůže. Představuji vám komplexní platformu Ranktracker pro efektivní SEO.

Konečně jsme otevřeli registraci do nástroje Ranktracker zcela zdarma!

Vytvoření bezplatného účtu

Nebo se přihlaste pomocí svých přihlašovacích údajů

Toto pořadí není náhodné a představuje celý závěr.

Nikdo nedělá chybu. Každý se rozhoduje

Podívejte se na dva provozovatele, kteří provozují jak trénovací, tak vyhledávací crawler.

Blokuje obojí Blokuje trénování, umožňuje vyhledávání Blokuje vyhledávání, umožňuje trénování
OpenAI, GPTBot / OAI-SearchBot 9 % 5 % 0 %
Anthropic, ClaudeBot / Claude-SearchBot 10 % 7 % 0

Dvanáct domén blokuje GPTBot, zatímco záměrně povoluje OAI-SearchBot. Patnáct domén postupuje stejně v případě Anthropic. Jedná se o soudržnou politiku: neškolte se na mém obsahu, ale citujte mě.

Nikdo nedělá opak.

Další dvě čísla ukazují stejným směrem. Pouze čtyři domény v celém vzorku používají plošný zákaz User-agent: * root a přesně jedna blokuje AI agenta, aniž by výslovně jmenovala jakéhokoli AI agenta. Kdokoli tyto soubory upravuje, ví, které agenty existují a co každý z nich dělá.

Varování odvětví se tedy týká problému, který v tomto vzorku neexistuje. Zajímavou otázkou není, zda jste vyhledávací agenty zablokovali omylem. Jde o to, zda jste to udělali záměrně.

Protože 18 % těchto domén blokuje alespoň jednoho vyhledávacího agenta a 4 % blokují všechny čtyři. Tyto weby se rozhodly, že se nebudou zobrazovat v odpovědích AI, a podle těchto důkazů to udělaly záměrně.

5 způsobů, jak to dnes napravit

  1. Považujte trénování a vyhledávání za dvě samostatné otázky. Jedná se o odlišná rozhodnutí a trh je již rozdělil. Většina vydavatelů chce to druhé bez toho prvního. Napište soubor tímto způsobem, místo abyste „AI crawlery“ považovali za jednu kategorii.

  2. Každého agenta pojmenujte explicitně. Pouze čtyři domény zde spoléhají na zástupný znak, a to z dobrého důvodu: pouhé User-agent: * disallow zachytí agenty, kteří neexistovali v době, kdy jste to psali, a zachytí i agenty, kteří ještě neexistují. Dva z nejvíce blokovaných agentů v těchto výsledcích, Bytespider a meta-externalagent, jsou novější než většina rad ohledně souboru robots.txt, které stále kolují.

  3. Zkontrolujte OAI-SearchBot a Claude-SearchBot podle názvu. Právě tito dva rozhodují o tom, zda můžete být citováni. Devět a deset procent vzorku je blokuje. Pokud patříte do této skupiny a neměli jste to v úmyslu, je to právě tento řádek, který je třeba změnit, a je to jediná položka na tomto seznamu, která má okamžitý dopad na viditelnost.

  4. Provádějte kontrolu každé čtvrtletí. V uplynulém roce se několikrát objevili noví agenti. Soubor napsaný před osmnácti měsíci bude mít chybějící položky, bez ohledu na to, jak pečlivě byl tehdy sepsán.

  5. Ověřujte na okraji sítě, nejen v souboru. Pravidla pro správu robotů ve vaší síti CDN mohou blokovat agenta, kterého soubor robots.txt výslovně povoluje, a soubor vám o tom nic neřekne. To je chyba, která přežije i dokonalý soubor robots.txt.

Výchozí bod, který rozlišuje mezi těmito dvěma rozhodnutími:

# Citujte mě. Tyto roboty načítávají stránky pro citace v živých odpovědích.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Seznamte se s nástrojem Ranktracker

Univerzální platforma pro efektivní SEO

Za každým úspěšným podnikem stojí silná kampaň SEO. Vzhledem k nesčetným optimalizačním nástrojům a technikám je však těžké zjistit, kde začít. No, už se nebojte, protože mám pro vás přesně to, co vám pomůže. Představuji vám komplexní platformu Ranktracker pro efektivní SEO.

Konečně jsme otevřeli registraci do nástroje Ranktracker zcela zdarma!

Vytvoření bezplatného účtu

Nebo se přihlaste pomocí svých přihlašovacích údajů

User-agent: DuckAssistBot Allow: /

Nepoužívejte mě k trénování. Pokud nesouhlasíte, změňte tyto položky na Allow.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

To se blíží konfiguraci, kterou již používá dvanáct až patnáct domén v tomto vzorku. V současné době se jedná spíše o běžný postup než o nějaký chytrý nápad.

Proč se nic z toho neobjevuje ve zprávách, které již sledujete

Search Console vykazuje Googlebot. O OAI-SearchBot se nezmiňuje. Analytics vykazuje relace a vyhledávač, který na vás nikdy neodkazuje, neposílá žádné relace, které by chyběly. Nástroje pro sledování pozic vykazují pozice a vaše pozice tím nejsou nijak ovlivněny.

Seznamte se s nástrojem Ranktracker

Univerzální platforma pro efektivní SEO

Za každým úspěšným podnikem stojí silná kampaň SEO. Vzhledem k nesčetným optimalizačním nástrojům a technikám je však těžké zjistit, kde začít. No, už se nebojte, protože mám pro vás přesně to, co vám pomůže. Představuji vám komplexní platformu Ranktracker pro efektivní SEO.

Konečně jsme otevřeli registraci do nástroje Ranktracker zcela zdarma!

Vytvoření bezplatného účtu

Nebo se přihlaste pomocí svých přihlašovacích údajů

Existují dva způsoby, jak to odhalit. Přečíst si soubor přímo, což bylo provedeno v rámci této studie. Nebo postupovat zpětně od příznaku pomocí nástroje pro kontrolu viditelnosti s umělou inteligencí, který podle plánu klade vyhledávačům otázky týkající se vaší kategorie a sleduje, zda se neobjeví odpověď, že vás vůbec nevidí.

Audit prohledávačů, na kterém je tato studie založena, provádíme v Honeyb, kde porovnáváme každého jmenovaného agenta z výše uvedeného katalogu s pravidly robots.txt daného webu podle plánu, nikoli jednorázově. Přístup je první ze čtyř věcí, které kontroluje. Dalšími třemi jsou: zda vás vyhledávače doporučují, co konkrétně je třeba změnit a následně vytvoření a zveřejnění obsahu, který tyto změny zohlední.

Dvě omezení, která stojí za zmínku

Tento vzorek představuje komerční výsledky vyhledávání (SERP) v USA, takže je zkreslen ve prospěch velkých vydavatelů a zavedených značek, které disponují jak povědomím, tak právním poradenstvím, aby v této věci mohly učinit uvážené rozhodnutí. Vzorek webů malých podniků by s velkou pravděpodobností vypadal jinak a příběh o náhodném blokování by se tam mohl ukázat jako pravdivý. To bychom prověřili jako další.

A soubor robots.txt zaznamenává záměr, nikoli vynucení. Netestovali jsme, zda tyto domény skutečně poskytují obsah každému agentovi, což je oblast, kde platí pravidla CDN a kde se obvykle objevuje rozpor mezi obsahem souboru a realitou.

Platforma, na které tato studie běží, je honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Začněte používat Ranktracker... zdarma!

Zjistěte, co brání vašemu webu v umístění.

Vytvoření bezplatného účtu

Nebo se přihlaste pomocí svých přihlašovacích údajů

Different views of Ranktracker app