Wprowadzenie
Każdy artykuł na temat robotów indeksujących opartych na sztucznej inteligencji ostrzega przed tym samym błędem. Ostrzeżenie brzmi: zablokowałeś GPTBota podczas paniki związanej ze scrapingiem w 2023 roku i przypadkowo zablokowałeś nowsze agenty, które pobierają strony w celu cytowania w odpowiedziach na żywo. Chciałeś zatrzymać roboty szkoleniowe i nieświadomie zrezygnowałeś z bycia rekomendowanym.
Sprawdziliśmy, czy rzeczywiście tak się dzieje.
Na 219 domenach nie zdarzyło się to ani razu.
Nie „rzadko”. Nie „w kilku przypadkach”. Ani razu.
Metoda
Wybraliśmy dwadzieścia najlepszych wyników organicznych dla 26 zapytań komercyjnych z siedmiu kategorii: SaaS, e-commerce, finanse, zdrowie, podróże, dom i marketing. Dało to 254 unikalne domeny. 28 lipca 2026 r. pobraliśmy pliki robots.txt dla każdej z nich, a 219 z nich udało się rozpoznać. Siedem z nich w ogóle nie udostępniało pliku robots.txt, co oznacza, że zezwalały na wszystko.
Dla każdej domeny porównaliśmy każdy agent użytkownika AI z plikiem, stosując standardową zasadę pierwszeństwa: wygrywa najbardziej szczegółowa grupa User-agent, więc dokładne dopasowanie agenta ma pierwszeństwo przed *. Domena jest uznawana za blokującą agenta, gdy jej zwycięska grupa nie zezwala na dostęp do katalogu głównego witryny bez bardziej szczegółowego zezwolenia.
Sprawdzono dwanaście agentów, podzielonych według rodzaju dostarczanych treści.
| Agent | Operator | Kanały |
| GPTBot | OpenAI | szkolenie |
| OAI-SearchBot | OpenAI | Cytaty z wyszukiwania ChatGPT |
| ClaudeBot | Anthropic | szkolenie |
| Claude-SearchBot | Anthropic | Wyszukiwanie cytatów Claude'a |
| PerplexityBot | Perplexity | odpowiedzi |
| DuckAssistBot | DuckDuckGo | odpowiedzi |
| Amazonbot | Amazon | odpowiedzi |
| CCBot | Common Crawl | korpus, z którego czerpie wiele modeli |
| Google-Extended | Szkolenie Gemini, a nie wyszukiwarka | |
| Applebot-Extended | Apple | szkolenie |
| Bytespider | ByteDance | szkolenie |
| meta-agent zewnętrzny | Meta | szkolenie |
Wyniki
77% tych domen zezwala na każdy agent AI. 23% blokuje co najmniej jednego.
| Agent | Zablokowany | Domeny, w których pojawia się ta nazwa wprost |
| Bytespider | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-Extended | 16% | 46 |
| meta-externalagent | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| Claude-SearchBot | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
Najrzadziej blokowanym agentem jest ten, który pobiera strony dla ChatGPT w celu cytowania. Najczęściej blokowanymi agentami są te, które zbierają dane do korpusów szkoleniowych.
Platforma "wszystko w jednym" dla skutecznego SEO
Za każdym udanym biznesem stoi silna kampania SEO. Ale z niezliczonych narzędzi optymalizacji i technik tam do wyboru, może być trudno wiedzieć, gdzie zacząć. Cóż, nie obawiaj się więcej, ponieważ mam właśnie coś, co może pomóc. Przedstawiamy Ranktracker - platformę all-in-one dla skutecznego SEO.
W końcu otworzyliśmy rejestrację do Ranktrackera całkowicie za darmo!
Załóż darmowe kontoLub Zaloguj się używając swoich danych uwierzytelniających
Ta kolejność nie jest przypadkowa i stanowi całość ustaleń.
Nikt nie popełnia błędu. Każdy podejmuje decyzję
Spójrzmy na dwóch operatorów, którzy prowadzą zarówno robota indeksującego do celów szkoleniowych, jak i robota indeksującego do celów wyszukiwania.
| Blokuje oba | Blokuje szkolenie, zezwala na wyszukiwanie | Blokuje wyszukiwanie, zezwala na uczenie | |
| OpenAI, GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic, ClaudeBot / Claude-SearchBot | 10% | 7% | 0% |
Dwanaście domen blokuje GPTBot, jednocześnie celowo zezwalając na działanie OAI-SearchBot. Piętnaście postępuje analogicznie w przypadku Anthropic. Jest to spójna polityka: nie szkolcie się na moich treściach, ale cytujcie mnie.
Nikt nie postępuje odwrotnie.
Dwie kolejne liczby wskazują na to samo. Tylko cztery domeny w całej próbie stosują ogólny zakaz User-agent: * root, a dokładnie jedna blokuje agenta AI bez wyraźnego wymieniania żadnego agenta AI. Ktokolwiek edytuje te pliki, wie, jakie agenty istnieją i czym się zajmuje każdy z nich.
Zatem ostrzeżenie branżowe dotyczy problemu, który w tej próbie nie istnieje. Interesujące pytanie nie brzmi, czy zablokowałeś agenty wyszukiwania przez przypadek. Chodzi o to, czy zrobiłeś to celowo.
Ponieważ 18% tych domen blokuje co najmniej jednego agenta wyszukiwania, a 4% blokuje wszystkie cztery. Witryny te zrezygnowały z pojawiania się w wynikach opartych na sztucznej inteligencji i na podstawie tych dowodów zrobiły to celowo.
5 sposobów, by to naprawić już dziś
-
Traktuj szkolenie i wyszukiwanie jako dwie odrębne kwestie. Są to różne decyzje, a rynek już je rozdzielił. Większość wydawców chce tego drugiego bez tego pierwszego. Napisz plik w ten sposób, zamiast traktować „roboty indeksujące AI” jako jedną kategorię.
-
Wymień wyraźnie każdego agenta. Tylko cztery domeny w tym zestawieniu opierają się na symbolu wieloznacznym, i to z ważnego powodu: samo User-agent: * disallow blokuje agentów, którzy nie istnieli w momencie pisania tego pliku, a także tych, którzy jeszcze nie istnieją. Dwaj najczęściej blokowani agenci w tych wynikach, Bytespider i meta-externalagent, są nowsi od większości porad dotyczących pliku robots.txt, które wciąż krążą.
-
Sprawdź OAI-SearchBot i Claude-SearchBot z nazwy. Te dwa agenty decydują o tym, czy Twoja strona może być cytowana. Blokuje je odpowiednio dziewięć i dziesięć procent badanych witryn. Jeśli należysz do tej grupy, a nie było to Twoim zamiarem, to właśnie tę linię należy zmienić – jest to jedyna pozycja na tej liście, której zmiana ma natychmiastowy wpływ na widoczność witryny.
-
Powtarzaj audyt co kwartał. W ciągu ostatniego roku kilkakrotnie pojawiły się nowe agenty. W pliku napisanym osiemnaście miesięcy temu brakuje wpisów, niezależnie od tego, jak starannie został on wówczas sporządzony.
-
Sprawdzaj na obrzeżach sieci, a nie tylko w pliku. Zasady zarządzania botami w Twojej sieci CDN mogą blokować agenta, na którego plik robots.txt wyraźnie zezwala, a sam plik nic Ci o tym nie powie. To właśnie ta usterka przetrwa nawet idealny plik robots.txt.
Punkt wyjścia, który pozwala odróżnić te dwie decyzje:
# Cytuj mnie. Te boty pobierają strony w celu cytowania w odpowiedziach na żywo.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Poznaj RanktrackerPlatforma "wszystko w jednym" dla skutecznego SEO
Za każdym udanym biznesem stoi silna kampania SEO. Ale z niezliczonych narzędzi optymalizacji i technik tam do wyboru, może być trudno wiedzieć, gdzie zacząć. Cóż, nie obawiaj się więcej, ponieważ mam właśnie coś, co może pomóc. Przedstawiamy Ranktracker - platformę all-in-one dla skutecznego SEO.
W końcu otworzyliśmy rejestrację do Ranktrackera całkowicie za darmo!
Załóż darmowe kontoLub Zaloguj się używając swoich danych uwierzytelniających
User-agent: DuckAssistBot
Allow: /
Nie wykorzystuj mnie do uczenia. Zmień te ustawienia na „Allow”, jeśli się z tym nie zgadzasz.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Jest to zbliżone do konfiguracji, z której korzysta już od dwunastu do piętnastu domen w tej próbie. Obecnie jest to raczej powszechne podejście niż sprytne rozwiązanie.
Dlaczego nic z tego nie pojawia się w raporcie, który już generujesz
Search Console raportuje dane dotyczące Googlebota. Nie wspomina nic o OAI-SearchBot. Analytics raportuje sesje, a silnik, który nigdy nie cytuje Twojej witryny, nie generuje żadnych sesji, których mogłoby brakować. Narzędzia do śledzenia pozycji raportują pozycje, a żadna z tych sytuacji nie ma na nie wpływu.
Platforma "wszystko w jednym" dla skutecznego SEO
Za każdym udanym biznesem stoi silna kampania SEO. Ale z niezliczonych narzędzi optymalizacji i technik tam do wyboru, może być trudno wiedzieć, gdzie zacząć. Cóż, nie obawiaj się więcej, ponieważ mam właśnie coś, co może pomóc. Przedstawiamy Ranktracker - platformę all-in-one dla skutecznego SEO.
W końcu otworzyliśmy rejestrację do Ranktrackera całkowicie za darmo!
Załóż darmowe kontoLub Zaloguj się używając swoich danych uwierzytelniających
Są dwa sposoby, aby to wykryć. Przeczytaj plik bezpośrednio, co zrobiono w ramach niniejszego badania. Albo prześledź problem wstecz, korzystając z narzędzia do sprawdzania widoczności opartego na sztucznej inteligencji, zadając wyszukiwarkom pytania dotyczące Twojej kategorii zgodnie z harmonogramem i wypatrując odpowiedzi, która mówi, że w ogóle Cię nie widzą.
Audyt indeksujący stanowiący podstawę tego badania to ten, który przeprowadzamy w Honeyb, porównując każdy wymieniony w powyższym katalogu agent z regułami pliku robots.txt danej witryny zgodnie z harmonogramem, a nie jednorazowo. Dostęp jest pierwszą z czterech spraw, które sprawdza. Pozostałe trzy to: czy wyszukiwarki Cię rekomendują, co konkretnie należy zmienić, a następnie stworzenie i opublikowanie treści, która wprowadza te zmiany.
Dwa ograniczenia, o których warto wspomnieć
Próbka ta obejmuje komercyjne wyniki wyszukiwania w USA, więc jest ona nastawiona na dużych wydawców i uznane marki, które dysponują zarówno świadomością, jak i doradztwem prawnym, pozwalającym im podjąć w tej kwestii przemyślaną decyzję. Próbka witryn małych firm najprawdopodobniej wyglądałaby inaczej, a historia o przypadkowym blokowaniu mogłaby się tam okazać prawdziwa. Przeprowadzimy to badanie w następnej kolejności.
Plik robots.txt odzwierciedla intencje, a nie egzekwowanie zasad. Nie sprawdzaliśmy, czy domeny te faktycznie dostarczają treści poszczególnym agentom – właśnie w tym zakresie obowiązują reguły CDN i właśnie tam często pojawia się rozbieżność między treścią pliku a rzeczywistością.
Platforma, na której opiera się niniejsze badanie, znajduje się pod adresem honeyb.ai.

