• AI SEO

5 najlepszych sposobów na poprawienie pliku robots.txt pod kątem robotów indeksujących opartych na sztucznej inteligencji – po sprawdzeniu 219 domen

  • Felix Rose-Collins
  • 5 min read

Wprowadzenie

Każdy artykuł na temat robotów indeksujących opartych na sztucznej inteligencji ostrzega przed tym samym błędem. Ostrzeżenie brzmi: zablokowałeś GPTBota podczas paniki związanej ze scrapingiem w 2023 roku i przypadkowo zablokowałeś nowsze agenty, które pobierają strony w celu cytowania w odpowiedziach na żywo. Chciałeś zatrzymać roboty szkoleniowe i nieświadomie zrezygnowałeś z bycia rekomendowanym.

Sprawdziliśmy, czy rzeczywiście tak się dzieje.

Na 219 domenach nie zdarzyło się to ani razu.

Nie „rzadko”. Nie „w kilku przypadkach”. Ani razu.

Metoda

Wybraliśmy dwadzieścia najlepszych wyników organicznych dla 26 zapytań komercyjnych z siedmiu kategorii: SaaS, e-commerce, finanse, zdrowie, podróże, dom i marketing. Dało to 254 unikalne domeny. 28 lipca 2026 r. pobraliśmy pliki robots.txt dla każdej z nich, a 219 z nich udało się rozpoznać. Siedem z nich w ogóle nie udostępniało pliku robots.txt, co oznacza, że zezwalały na wszystko.

Dla każdej domeny porównaliśmy każdy agent użytkownika AI z plikiem, stosując standardową zasadę pierwszeństwa: wygrywa najbardziej szczegółowa grupa User-agent, więc dokładne dopasowanie agenta ma pierwszeństwo przed *. Domena jest uznawana za blokującą agenta, gdy jej zwycięska grupa nie zezwala na dostęp do katalogu głównego witryny bez bardziej szczegółowego zezwolenia.

Sprawdzono dwanaście agentów, podzielonych według rodzaju dostarczanych treści.

Agent Operator Kanały
GPTBot OpenAI szkolenie
OAI-SearchBot OpenAI Cytaty z wyszukiwania ChatGPT
ClaudeBot Anthropic szkolenie
Claude-SearchBot Anthropic Wyszukiwanie cytatów Claude'a
PerplexityBot Perplexity odpowiedzi
DuckAssistBot DuckDuckGo odpowiedzi
Amazonbot Amazon odpowiedzi
CCBot Common Crawl korpus, z którego czerpie wiele modeli
Google-Extended Google Szkolenie Gemini, a nie wyszukiwarka
Applebot-Extended Apple szkolenie
Bytespider ByteDance szkolenie
meta-agent zewnętrzny Meta szkolenie

Wyniki

77% tych domen zezwala na każdy agent AI. 23% blokuje co najmniej jednego.

Agent Zablokowany Domeny, w których pojawia się ta nazwa wprost
Bytespider 20% 45
CCBot 20% 47
ClaudeBot 17% 50
Google-Extended 16% 46
meta-externalagent 16% 38
PerplexityBot 15% 44
GPTBot 14% 53
Applebot-Extended 14% 39
Amazonbot 13% 39
Claude-SearchBot 10% 22
DuckAssistBot 10% 24
OAI-SearchBot 9% 34

Najrzadziej blokowanym agentem jest ten, który pobiera strony dla ChatGPT w celu cytowania. Najczęściej blokowanymi agentami są te, które zbierają dane do korpusów szkoleniowych.

Poznaj Ranktracker

Platforma "wszystko w jednym" dla skutecznego SEO

Za każdym udanym biznesem stoi silna kampania SEO. Ale z niezliczonych narzędzi optymalizacji i technik tam do wyboru, może być trudno wiedzieć, gdzie zacząć. Cóż, nie obawiaj się więcej, ponieważ mam właśnie coś, co może pomóc. Przedstawiamy Ranktracker - platformę all-in-one dla skutecznego SEO.

W końcu otworzyliśmy rejestrację do Ranktrackera całkowicie za darmo!

Załóż darmowe konto

Lub Zaloguj się używając swoich danych uwierzytelniających

Ta kolejność nie jest przypadkowa i stanowi całość ustaleń.

Nikt nie popełnia błędu. Każdy podejmuje decyzję

Spójrzmy na dwóch operatorów, którzy prowadzą zarówno robota indeksującego do celów szkoleniowych, jak i robota indeksującego do celów wyszukiwania.

Blokuje oba Blokuje szkolenie, zezwala na wyszukiwanie Blokuje wyszukiwanie, zezwala na uczenie
OpenAI, GPTBot / OAI-SearchBot 9% 5% 0%
Anthropic, ClaudeBot / Claude-SearchBot 10% 7% 0%

Dwanaście domen blokuje GPTBot, jednocześnie celowo zezwalając na działanie OAI-SearchBot. Piętnaście postępuje analogicznie w przypadku Anthropic. Jest to spójna polityka: nie szkolcie się na moich treściach, ale cytujcie mnie.

Nikt nie postępuje odwrotnie.

Dwie kolejne liczby wskazują na to samo. Tylko cztery domeny w całej próbie stosują ogólny zakaz User-agent: * root, a dokładnie jedna blokuje agenta AI bez wyraźnego wymieniania żadnego agenta AI. Ktokolwiek edytuje te pliki, wie, jakie agenty istnieją i czym się zajmuje każdy z nich.

Zatem ostrzeżenie branżowe dotyczy problemu, który w tej próbie nie istnieje. Interesujące pytanie nie brzmi, czy zablokowałeś agenty wyszukiwania przez przypadek. Chodzi o to, czy zrobiłeś to celowo.

Ponieważ 18% tych domen blokuje co najmniej jednego agenta wyszukiwania, a 4% blokuje wszystkie cztery. Witryny te zrezygnowały z pojawiania się w wynikach opartych na sztucznej inteligencji i na podstawie tych dowodów zrobiły to celowo.

5 sposobów, by to naprawić już dziś

  1. Traktuj szkolenie i wyszukiwanie jako dwie odrębne kwestie. Są to różne decyzje, a rynek już je rozdzielił. Większość wydawców chce tego drugiego bez tego pierwszego. Napisz plik w ten sposób, zamiast traktować „roboty indeksujące AI” jako jedną kategorię.

  2. Wymień wyraźnie każdego agenta. Tylko cztery domeny w tym zestawieniu opierają się na symbolu wieloznacznym, i to z ważnego powodu: samo User-agent: * disallow blokuje agentów, którzy nie istnieli w momencie pisania tego pliku, a także tych, którzy jeszcze nie istnieją. Dwaj najczęściej blokowani agenci w tych wynikach, Bytespider i meta-externalagent, są nowsi od większości porad dotyczących pliku robots.txt, które wciąż krążą.

  3. Sprawdź OAI-SearchBot i Claude-SearchBot z nazwy. Te dwa agenty decydują o tym, czy Twoja strona może być cytowana. Blokuje je odpowiednio dziewięć i dziesięć procent badanych witryn. Jeśli należysz do tej grupy, a nie było to Twoim zamiarem, to właśnie tę linię należy zmienić – jest to jedyna pozycja na tej liście, której zmiana ma natychmiastowy wpływ na widoczność witryny.

  4. Powtarzaj audyt co kwartał. W ciągu ostatniego roku kilkakrotnie pojawiły się nowe agenty. W pliku napisanym osiemnaście miesięcy temu brakuje wpisów, niezależnie od tego, jak starannie został on wówczas sporządzony.

  5. Sprawdzaj na obrzeżach sieci, a nie tylko w pliku. Zasady zarządzania botami w Twojej sieci CDN mogą blokować agenta, na którego plik robots.txt wyraźnie zezwala, a sam plik nic Ci o tym nie powie. To właśnie ta usterka przetrwa nawet idealny plik robots.txt.

Punkt wyjścia, który pozwala odróżnić te dwie decyzje:

# Cytuj mnie. Te boty pobierają strony w celu cytowania w odpowiedziach na żywo.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Poznaj Ranktracker

Platforma "wszystko w jednym" dla skutecznego SEO

Za każdym udanym biznesem stoi silna kampania SEO. Ale z niezliczonych narzędzi optymalizacji i technik tam do wyboru, może być trudno wiedzieć, gdzie zacząć. Cóż, nie obawiaj się więcej, ponieważ mam właśnie coś, co może pomóc. Przedstawiamy Ranktracker - platformę all-in-one dla skutecznego SEO.

W końcu otworzyliśmy rejestrację do Ranktrackera całkowicie za darmo!

Załóż darmowe konto

Lub Zaloguj się używając swoich danych uwierzytelniających

User-agent: DuckAssistBot Allow: /

Nie wykorzystuj mnie do uczenia. Zmień te ustawienia na „Allow”, jeśli się z tym nie zgadzasz.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Jest to zbliżone do konfiguracji, z której korzysta już od dwunastu do piętnastu domen w tej próbie. Obecnie jest to raczej powszechne podejście niż sprytne rozwiązanie.

Dlaczego nic z tego nie pojawia się w raporcie, który już generujesz

Search Console raportuje dane dotyczące Googlebota. Nie wspomina nic o OAI-SearchBot. Analytics raportuje sesje, a silnik, który nigdy nie cytuje Twojej witryny, nie generuje żadnych sesji, których mogłoby brakować. Narzędzia do śledzenia pozycji raportują pozycje, a żadna z tych sytuacji nie ma na nie wpływu.

Poznaj Ranktracker

Platforma "wszystko w jednym" dla skutecznego SEO

Za każdym udanym biznesem stoi silna kampania SEO. Ale z niezliczonych narzędzi optymalizacji i technik tam do wyboru, może być trudno wiedzieć, gdzie zacząć. Cóż, nie obawiaj się więcej, ponieważ mam właśnie coś, co może pomóc. Przedstawiamy Ranktracker - platformę all-in-one dla skutecznego SEO.

W końcu otworzyliśmy rejestrację do Ranktrackera całkowicie za darmo!

Załóż darmowe konto

Lub Zaloguj się używając swoich danych uwierzytelniających

Są dwa sposoby, aby to wykryć. Przeczytaj plik bezpośrednio, co zrobiono w ramach niniejszego badania. Albo prześledź problem wstecz, korzystając z narzędzia do sprawdzania widoczności opartego na sztucznej inteligencji, zadając wyszukiwarkom pytania dotyczące Twojej kategorii zgodnie z harmonogramem i wypatrując odpowiedzi, która mówi, że w ogóle Cię nie widzą.

Audyt indeksujący stanowiący podstawę tego badania to ten, który przeprowadzamy w Honeyb, porównując każdy wymieniony w powyższym katalogu agent z regułami pliku robots.txt danej witryny zgodnie z harmonogramem, a nie jednorazowo. Dostęp jest pierwszą z czterech spraw, które sprawdza. Pozostałe trzy to: czy wyszukiwarki Cię rekomendują, co konkretnie należy zmienić, a następnie stworzenie i opublikowanie treści, która wprowadza te zmiany.

Dwa ograniczenia, o których warto wspomnieć

Próbka ta obejmuje komercyjne wyniki wyszukiwania w USA, więc jest ona nastawiona na dużych wydawców i uznane marki, które dysponują zarówno świadomością, jak i doradztwem prawnym, pozwalającym im podjąć w tej kwestii przemyślaną decyzję. Próbka witryn małych firm najprawdopodobniej wyglądałaby inaczej, a historia o przypadkowym blokowaniu mogłaby się tam okazać prawdziwa. Przeprowadzimy to badanie w następnej kolejności.

Plik robots.txt odzwierciedla intencje, a nie egzekwowanie zasad. Nie sprawdzaliśmy, czy domeny te faktycznie dostarczają treści poszczególnym agentom – właśnie w tym zakresie obowiązują reguły CDN i właśnie tam często pojawia się rozbieżność między treścią pliku a rzeczywistością.

Platforma, na której opiera się niniejsze badanie, znajduje się pod adresem honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Zacznij używać Ranktrackera... Za darmo!

Dowiedz się, co powstrzymuje Twoją witrynę przed zajęciem miejsca w rankingu.

Załóż darmowe konto

Lub Zaloguj się używając swoich danych uwierzytelniających

Different views of Ranktracker app