Introducere
Fiecare articol despre crawlerele AI te avertizează cu privire la aceeași greșeală. Ai blocat GPTBot în timpul panicii legate de scraping din 2023, spune avertismentul, și ai blocat din greșeală agenții mai noi care preiau pagini pentru a le cita în răspunsurile în timp real. Ai vrut să oprești scraperele de antrenament și, fără să-ți dai seama, ai renunțat la a mai primi recomandări.
Am verificat dacă acest lucru se întâmplă cu adevărat.
Pe 219 de domenii, acest lucru nu s-a întâmplat nici măcar o dată.
Nu rar. Nu în câteva cazuri. Nici măcar o dată.
Metodă
Am selectat primele douăzeci de rezultate organice pentru 26 de interogări comerciale din șapte categorii: SaaS, comerț electronic, finanțe, sănătate, călătorii, casă și marketing. Astfel am obținut 254 de domenii unice. Am preluat fișierul robots.txt pentru fiecare dintre acestea pe 28 iulie 2026, iar 219 au fost rezolvate. Șapte dintre acestea nu furnizau deloc un fișier robots.txt, ceea ce înseamnă că permit accesul la orice.
Pentru fiecare domeniu, am verificat fiecare agent de utilizator AI în raport cu fișierul, folosind regula standard de prioritate: grupul de agenți de utilizator cu cea mai specifică potrivire prevalează, astfel încât o potrivire exactă a agentului are prioritate față de *. Un domeniu este considerat că blochează un agent atunci când grupul său câștigător interzice accesul la rădăcina site-ului fără o permisiune mai specifică.
Au fost verificați doisprezece agenți, împărțiți în funcție de conținutul pe care îl furnizează.
| Agent | Operator | Fluxuri |
| GPTBot | OpenAI | antrenare |
| OAI-SearchBot | OpenAI | Citări din căutările ChatGPT |
| ClaudeBot | Anthropic | antrenare |
| Claude-SearchBot | Anthropic | Citări din căutările lui Claude |
| PerplexityBot | Perplexity | răspunsuri |
| DuckAssistBot | DuckDuckGo | răspunsuri |
| Amazonbot | Amazon | răspunsuri |
| CCBot | Common Crawl | un corpus pe care se bazează multe modele |
| Google-Extended | Antrenarea modelului Gemini, nu a motorului de căutare | |
| Applebot-Extended | Apple | antrenament |
| Bytespider | ByteDance | instruire |
| meta-agent extern | Meta | antrenament |
Rezultate
77% dintre aceste domenii permit accesul tuturor agenților AI. Douăzeci și trei la sută blochează cel puțin unul.
| Agent | Blocat | Domenii care îl menționează explicit |
| Bytespider | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-Extended | 16% | 46 |
| meta-agent extern | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| Claude-SearchBot | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
Agentul blocat cel mai rar este cel care preia pagini pe care ChatGPT le citează. Agenții blocați cel mai des sunt cei care extrag date pentru corpusuri de antrenare.
Platforma All-in-One pentru un SEO eficient
În spatele fiecărei afaceri de succes se află o campanie SEO puternică. Dar, având în vedere că există nenumărate instrumente și tehnici de optimizare din care puteți alege, poate fi greu să știți de unde să începeți. Ei bine, nu vă mai temeți, pentru că am exact ceea ce vă poate ajuta. Vă prezentăm platforma Ranktracker all-in-one pentru un SEO eficient
Am deschis în sfârșit înregistrarea la Ranktracker absolut gratuit!
Creați un cont gratuitSau Conectați-vă folosind acreditările dvs.
Această ordine nu este întâmplătoare și reprezintă întreaga constatare.
Nimeni nu face o greșeală. Toată lumea ia o decizie
Priviți cei doi operatori care gestionează atât un crawler de antrenare, cât și unul de căutare.
| Blochează ambele | Blochează antrenarea, permite căutarea | Blochează căutarea, permite antrenarea | |
| OpenAI, GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic, ClaudeBot / Claude-SearchBot | 10% | 7% | 0 |
Douăsprezece domenii blochează GPTBot, în timp ce permit în mod deliberat accesul lui OAI-SearchBot. Cincisprezece fac același lucru pentru Anthropic. Aceasta este o politică coerentă: nu vă antrenați pe conținutul meu, dar citați-mă.
Nimeni nu face invers.
Alte două cifre indică același lucru. Doar patru domenii din întregul eșantion folosesc o interdicție generală de tip User-agent: * root, iar exact unul blochează un agent AI fără a numi explicit vreun agent AI. Oricine editează aceste fișiere știe ce agenți există și ce face fiecare dintre ei.
Așadar, avertismentul industriei abordează o problemă care, în acest eșantion, nu există. Întrebarea interesantă nu este dacă ați blocat agenții de căutare din greșeală. Ci dacă ați făcut-o intenționat.
Deoarece 18% dintre aceste domenii blochează cel puțin un agent de căutare, iar 4% le blochează pe toate patru. Aceste site-uri au ales să nu apară în răspunsurile oferite de IA și, pe baza acestor dovezi, au făcut-o intenționat.
Cele 5 modalități de a remedia situația astăzi
-
Tratați antrenarea și căutarea ca două chestiuni separate. Sunt decizii diferite, iar piața le-a separat deja. Majoritatea editorilor doresc a doua fără prima. Scrieți fișierul în acest mod, în loc să tratați „crawlerele AI” ca pe o singură categorie.
-
Denumiți fiecare agent în mod explicit. Doar patru domenii de aici se bazează pe caracterul wildcard, și pe bună dreptate: o simplă instrucțiune User-agent: * disallow blochează agenți care nu existau când ați scris-o și va bloca agenți care încă nu există. Doi dintre cei mai blocați agenți din aceste rezultate, Bytespider și meta-externalagent, sunt mai recenți decât majoritatea sfaturilor privind fișierul robots.txt care încă circulă.
-
Verificați OAI-SearchBot și Claude-SearchBot după nume. Aceștia doi decid dacă puteți fi citați. Nouă și, respectiv, zece la sută din eșantion îi blochează. Dacă vă aflați în acel grup și nu ați intenționat acest lucru, aceasta este linia pe care trebuie să o modificați, fiind singurul element de pe această listă care are un cost imediat în ceea ce privește vizibilitatea.
-
Reevaluați trimestrial. Au apărut agenți noi de mai multe ori în ultimul an. Un fișier scris acum optsprezece luni are intrări lipsă, indiferent cât de atent a fost redactat la momentul respectiv.
-
Verificați la nivel de rețea, nu doar în fișier. Regulile de gestionare a roboților de la CDN-ul dvs. pot bloca un agent pe care fișierul robots.txt îl permite în mod explicit, iar fișierul nu vă va oferi nicio informație în acest sens. Aceasta este eroarea care poate apărea chiar și cu un fișier robots.txt perfect.
Un punct de plecare care face distincția între cele două decizii:
# Citează-mă. Aceștia preiau pagini pentru a le cita în răspunsurile în timp real.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Faceți cunoștință cu RanktrackerPlatforma All-in-One pentru un SEO eficient
În spatele fiecărei afaceri de succes se află o campanie SEO puternică. Dar, având în vedere că există nenumărate instrumente și tehnici de optimizare din care puteți alege, poate fi greu să știți de unde să începeți. Ei bine, nu vă mai temeți, pentru că am exact ceea ce vă poate ajuta. Vă prezentăm platforma Ranktracker all-in-one pentru un SEO eficient
Am deschis în sfârșit înregistrarea la Ranktracker absolut gratuit!
Creați un cont gratuitSau Conectați-vă folosind acreditările dvs.
User-agent: DuckAssistBot
Allow: /
Nu mă folosi pentru antrenare. Schimbă-le la „Allow” dacă nu ești de acord.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Aceasta se apropie de configurația pe care o folosesc deja între douăsprezece și cincisprezece domenii din acest eșantion. În prezent, este o poziție curentă, mai degrabă decât una ingenioasă.
De ce nimic din toate acestea nu apare într-un raport pe care îl rulați deja
Search Console raportează Googlebot. Nu menționează nimic despre OAI-SearchBot. Analytics raportează sesiunile, iar un motor care nu vă citează niciodată nu trimite sesiuni care să lipsească. Instrumentele de monitorizare a pozițiilor raportează clasamentele, iar pozițiile dvs. nu sunt afectate de nimic din toate acestea.
Platforma All-in-One pentru un SEO eficient
În spatele fiecărei afaceri de succes se află o campanie SEO puternică. Dar, având în vedere că există nenumărate instrumente și tehnici de optimizare din care puteți alege, poate fi greu să știți de unde să începeți. Ei bine, nu vă mai temeți, pentru că am exact ceea ce vă poate ajuta. Vă prezentăm platforma Ranktracker all-in-one pentru un SEO eficient
Am deschis în sfârșit înregistrarea la Ranktracker absolut gratuit!
Creați un cont gratuitSau Conectați-vă folosind acreditările dvs.
Există două modalități de a identifica acest lucru. Citiți fișierul direct, așa cum s-a procedat în cadrul acestui studiu. Sau porniți de la simptom și lucrați în sens invers cu un instrument de verificare a vizibilității bazat pe IA, adresând motoarelor de căutare întrebări specifice categoriei dvs. la intervale regulate și urmărind răspunsul care indică faptul că acestea nu vă pot vedea deloc.
Auditul crawlerului care stă la baza acestui studiu este cel pe care îl efectuăm în Honeyb, verificând fiecare agent menționat în catalogul de mai sus în raport cu regulile de acces ale site-ului, la intervale regulate, nu doar o singură dată. Accesul este primul dintre cele patru aspecte pe care le verifică. Celelalte trei sunt: dacă motoarele de căutare vă recomandă, ce anume trebuie modificat și, apoi, crearea și publicarea conținutului care aduce aceste modificări.
Două limitări care merită menționate
Acest eșantion cuprinde paginile cu rezultate ale căutării (SERP) comerciale din SUA, deci este orientat către editorii mari și brandurile consacrate, care dispun atât de notorietate, cât și de consultanță juridică pentru a lua o decizie ponderată în acest sens. Un eșantion de site-uri ale întreprinderilor mici ar arăta foarte probabil diferit, iar povestea blocării accidentale s-ar putea dovedi a fi adevărată în acel context. Vom efectua acest test în continuare.
Iar un fișier robots.txt înregistrează intenția, nu aplicarea efectivă. Nu am testat dacă aceste domenii furnizează efectiv conținut fiecărui agent, iar aici intervin regulile CDN și aici tinde să se creeze discrepanța dintre fișier și realitate.
Platforma care stă la baza acestui studiu se află la honeyb.ai.

