• SEO bazat pe IA

Cele mai bune 5 metode de a optimiza fișierul robots.txt pentru crawlerele de IA, după verificarea a 219 de domenii

  • Felix Rose-Collins
  • 5 min read

Introducere

Fiecare articol despre crawlerele AI te avertizează cu privire la aceeași greșeală. Ai blocat GPTBot în timpul panicii legate de scraping din 2023, spune avertismentul, și ai blocat din greșeală agenții mai noi care preiau pagini pentru a le cita în răspunsurile în timp real. Ai vrut să oprești scraperele de antrenament și, fără să-ți dai seama, ai renunțat la a mai primi recomandări.

Am verificat dacă acest lucru se întâmplă cu adevărat.

Pe 219 de domenii, acest lucru nu s-a întâmplat nici măcar o dată.

Nu rar. Nu în câteva cazuri. Nici măcar o dată.

Metodă

Am selectat primele douăzeci de rezultate organice pentru 26 de interogări comerciale din șapte categorii: SaaS, comerț electronic, finanțe, sănătate, călătorii, casă și marketing. Astfel am obținut 254 de domenii unice. Am preluat fișierul robots.txt pentru fiecare dintre acestea pe 28 iulie 2026, iar 219 au fost rezolvate. Șapte dintre acestea nu furnizau deloc un fișier robots.txt, ceea ce înseamnă că permit accesul la orice.

Pentru fiecare domeniu, am verificat fiecare agent de utilizator AI în raport cu fișierul, folosind regula standard de prioritate: grupul de agenți de utilizator cu cea mai specifică potrivire prevalează, astfel încât o potrivire exactă a agentului are prioritate față de *. Un domeniu este considerat că blochează un agent atunci când grupul său câștigător interzice accesul la rădăcina site-ului fără o permisiune mai specifică.

Au fost verificați doisprezece agenți, împărțiți în funcție de conținutul pe care îl furnizează.

Agent Operator Fluxuri
GPTBot OpenAI antrenare
OAI-SearchBot OpenAI Citări din căutările ChatGPT
ClaudeBot Anthropic antrenare
Claude-SearchBot Anthropic Citări din căutările lui Claude
PerplexityBot Perplexity răspunsuri
DuckAssistBot DuckDuckGo răspunsuri
Amazonbot Amazon răspunsuri
CCBot Common Crawl un corpus pe care se bazează multe modele
Google-Extended Google Antrenarea modelului Gemini, nu a motorului de căutare
Applebot-Extended Apple antrenament
Bytespider ByteDance instruire
meta-agent extern Meta antrenament

Rezultate

77% dintre aceste domenii permit accesul tuturor agenților AI. Douăzeci și trei la sută blochează cel puțin unul.

Agent Blocat Domenii care îl menționează explicit
Bytespider 20% 45
CCBot 20% 47
ClaudeBot 17% 50
Google-Extended 16% 46
meta-agent extern 16% 38
PerplexityBot 15% 44
GPTBot 14% 53
Applebot-Extended 14% 39
Amazonbot 13% 39
Claude-SearchBot 10% 22
DuckAssistBot 10% 24
OAI-SearchBot 9% 34

Agentul blocat cel mai rar este cel care preia pagini pe care ChatGPT le citează. Agenții blocați cel mai des sunt cei care extrag date pentru corpusuri de antrenare.

Faceți cunoștință cu Ranktracker

Platforma All-in-One pentru un SEO eficient

În spatele fiecărei afaceri de succes se află o campanie SEO puternică. Dar, având în vedere că există nenumărate instrumente și tehnici de optimizare din care puteți alege, poate fi greu să știți de unde să începeți. Ei bine, nu vă mai temeți, pentru că am exact ceea ce vă poate ajuta. Vă prezentăm platforma Ranktracker all-in-one pentru un SEO eficient

Am deschis în sfârșit înregistrarea la Ranktracker absolut gratuit!

Creați un cont gratuit

Sau Conectați-vă folosind acreditările dvs.

Această ordine nu este întâmplătoare și reprezintă întreaga constatare.

Nimeni nu face o greșeală. Toată lumea ia o decizie

Priviți cei doi operatori care gestionează atât un crawler de antrenare, cât și unul de căutare.

Blochează ambele Blochează antrenarea, permite căutarea Blochează căutarea, permite antrenarea
OpenAI, GPTBot / OAI-SearchBot 9% 5% 0%
Anthropic, ClaudeBot / Claude-SearchBot 10% 7% 0

Douăsprezece domenii blochează GPTBot, în timp ce permit în mod deliberat accesul lui OAI-SearchBot. Cincisprezece fac același lucru pentru Anthropic. Aceasta este o politică coerentă: nu vă antrenați pe conținutul meu, dar citați-mă.

Nimeni nu face invers.

Alte două cifre indică același lucru. Doar patru domenii din întregul eșantion folosesc o interdicție generală de tip User-agent: * root, iar exact unul blochează un agent AI fără a numi explicit vreun agent AI. Oricine editează aceste fișiere știe ce agenți există și ce face fiecare dintre ei.

Așadar, avertismentul industriei abordează o problemă care, în acest eșantion, nu există. Întrebarea interesantă nu este dacă ați blocat agenții de căutare din greșeală. Ci dacă ați făcut-o intenționat.

Deoarece 18% dintre aceste domenii blochează cel puțin un agent de căutare, iar 4% le blochează pe toate patru. Aceste site-uri au ales să nu apară în răspunsurile oferite de IA și, pe baza acestor dovezi, au făcut-o intenționat.

Cele 5 modalități de a remedia situația astăzi

  1. Tratați antrenarea și căutarea ca două chestiuni separate. Sunt decizii diferite, iar piața le-a separat deja. Majoritatea editorilor doresc a doua fără prima. Scrieți fișierul în acest mod, în loc să tratați „crawlerele AI” ca pe o singură categorie.

  2. Denumiți fiecare agent în mod explicit. Doar patru domenii de aici se bazează pe caracterul wildcard, și pe bună dreptate: o simplă instrucțiune User-agent: * disallow blochează agenți care nu existau când ați scris-o și va bloca agenți care încă nu există. Doi dintre cei mai blocați agenți din aceste rezultate, Bytespider și meta-externalagent, sunt mai recenți decât majoritatea sfaturilor privind fișierul robots.txt care încă circulă.

  3. Verificați OAI-SearchBot și Claude-SearchBot după nume. Aceștia doi decid dacă puteți fi citați. Nouă și, respectiv, zece la sută din eșantion îi blochează. Dacă vă aflați în acel grup și nu ați intenționat acest lucru, aceasta este linia pe care trebuie să o modificați, fiind singurul element de pe această listă care are un cost imediat în ceea ce privește vizibilitatea.

  4. Reevaluați trimestrial. Au apărut agenți noi de mai multe ori în ultimul an. Un fișier scris acum optsprezece luni are intrări lipsă, indiferent cât de atent a fost redactat la momentul respectiv.

  5. Verificați la nivel de rețea, nu doar în fișier. Regulile de gestionare a roboților de la CDN-ul dvs. pot bloca un agent pe care fișierul robots.txt îl permite în mod explicit, iar fișierul nu vă va oferi nicio informație în acest sens. Aceasta este eroarea care poate apărea chiar și cu un fișier robots.txt perfect.

Un punct de plecare care face distincția între cele două decizii:

# Citează-mă. Aceștia preiau pagini pentru a le cita în răspunsurile în timp real.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Faceți cunoștință cu Ranktracker

Platforma All-in-One pentru un SEO eficient

În spatele fiecărei afaceri de succes se află o campanie SEO puternică. Dar, având în vedere că există nenumărate instrumente și tehnici de optimizare din care puteți alege, poate fi greu să știți de unde să începeți. Ei bine, nu vă mai temeți, pentru că am exact ceea ce vă poate ajuta. Vă prezentăm platforma Ranktracker all-in-one pentru un SEO eficient

Am deschis în sfârșit înregistrarea la Ranktracker absolut gratuit!

Creați un cont gratuit

Sau Conectați-vă folosind acreditările dvs.

User-agent: DuckAssistBot Allow: /

Nu mă folosi pentru antrenare. Schimbă-le la „Allow” dacă nu ești de acord.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Aceasta se apropie de configurația pe care o folosesc deja între douăsprezece și cincisprezece domenii din acest eșantion. În prezent, este o poziție curentă, mai degrabă decât una ingenioasă.

De ce nimic din toate acestea nu apare într-un raport pe care îl rulați deja

Search Console raportează Googlebot. Nu menționează nimic despre OAI-SearchBot. Analytics raportează sesiunile, iar un motor care nu vă citează niciodată nu trimite sesiuni care să lipsească. Instrumentele de monitorizare a pozițiilor raportează clasamentele, iar pozițiile dvs. nu sunt afectate de nimic din toate acestea.

Faceți cunoștință cu Ranktracker

Platforma All-in-One pentru un SEO eficient

În spatele fiecărei afaceri de succes se află o campanie SEO puternică. Dar, având în vedere că există nenumărate instrumente și tehnici de optimizare din care puteți alege, poate fi greu să știți de unde să începeți. Ei bine, nu vă mai temeți, pentru că am exact ceea ce vă poate ajuta. Vă prezentăm platforma Ranktracker all-in-one pentru un SEO eficient

Am deschis în sfârșit înregistrarea la Ranktracker absolut gratuit!

Creați un cont gratuit

Sau Conectați-vă folosind acreditările dvs.

Există două modalități de a identifica acest lucru. Citiți fișierul direct, așa cum s-a procedat în cadrul acestui studiu. Sau porniți de la simptom și lucrați în sens invers cu un instrument de verificare a vizibilității bazat pe IA, adresând motoarelor de căutare întrebări specifice categoriei dvs. la intervale regulate și urmărind răspunsul care indică faptul că acestea nu vă pot vedea deloc.

Auditul crawlerului care stă la baza acestui studiu este cel pe care îl efectuăm în Honeyb, verificând fiecare agent menționat în catalogul de mai sus în raport cu regulile de acces ale site-ului, la intervale regulate, nu doar o singură dată. Accesul este primul dintre cele patru aspecte pe care le verifică. Celelalte trei sunt: dacă motoarele de căutare vă recomandă, ce anume trebuie modificat și, apoi, crearea și publicarea conținutului care aduce aceste modificări.

Două limitări care merită menționate

Acest eșantion cuprinde paginile cu rezultate ale căutării (SERP) comerciale din SUA, deci este orientat către editorii mari și brandurile consacrate, care dispun atât de notorietate, cât și de consultanță juridică pentru a lua o decizie ponderată în acest sens. Un eșantion de site-uri ale întreprinderilor mici ar arăta foarte probabil diferit, iar povestea blocării accidentale s-ar putea dovedi a fi adevărată în acel context. Vom efectua acest test în continuare.

Iar un fișier robots.txt înregistrează intenția, nu aplicarea efectivă. Nu am testat dacă aceste domenii furnizează efectiv conținut fiecărui agent, iar aici intervin regulile CDN și aici tinde să se creeze discrepanța dintre fișier și realitate.

Platforma care stă la baza acestui studiu se află la honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Începeți să utilizați Ranktracker... Gratuit!

Aflați ce împiedică site-ul dvs. să se claseze.

Creați un cont gratuit

Sau Conectați-vă folosind acreditările dvs.

Different views of Ranktracker app