• AI SEO

5 geriausi būdai, kaip patobulinti „robots.txt“ failą dirbtinio intelekto paieškos robotams, patikrinus 219 domenų

  • Felix Rose-Collins
  • 4 min read

Įvadas

Kiekviename straipsnyje apie AI paieškos robotus įspėjama apie tą pačią klaidą. Įspėjime teigiama, kad per 2023 m. duomenų rinkimo paniką užblokavote „GPTBot“, o kartu netyčia užblokavote ir naujesnius agentus, kurie renka puslapius, kad galėtų juos cituoti tiesioginiuose atsakymuose. Jūs norėjote sustabdyti mokymo paieškos robotus, bet tyliai atsisakėte galimybės būti rekomenduojamiems.

Mes patikrinome, ar tai iš tiesų vyksta.

Iš 219 domenų tai neįvyko nė karto.

Ne retai. Ne keliuose atvejais. Nei vieno karto.

Metodika

Išrinkome dvidešimt populiariausių natūrinių paieškos rezultatų pagal 26 komercinius užklausimus septyniose kategorijose: SaaS, elektroninė prekyba, finansai, sveikata, kelionės, namai ir rinkodara. Taip gavome 254 unikalius domenus. 2026 m. liepos 28 d. iš kiekvieno iš jų atsisiuntėme „robots.txt“ failą, ir 219 iš jų buvo sėkmingai išspręsti. Septyni iš jų visai nepateikė „robots.txt“ failo, o tai reiškia, kad leidžiama viskas.

Kiekvienam domenui patikrinome kiekvieną AI vartotojo agentą pagal šį failą, taikydami standartinę pirmenybės taisyklę: laimi labiausiai konkretus atitinkantis „User-agent“ grupės elementas, taigi tiksliai atitinkantis agentas turi pirmenybę prieš „*“. Laikoma, kad domenas blokuoja agentą, kai jo laimėjusi grupė neleidžia patekti į svetainės šaknį be konkretesnio leidimo.

Buvo patikrinti dvylika agentų, suskirstytų pagal tai, ką jie pateikia.

Agentas Operatorius Srautas
GPTBot OpenAI mokymas
OAI-SearchBot OpenAI „ChatGPT“ paieškos citatos
ClaudeBot Anthropic mokymas
Claude-SearchBot Anthropic Claude paieškos citatos
PerplexityBot Perplexity atsakymai
DuckAssistBot DuckDuckGo atsakymai
Amazonbot „Amazon“ atsakymai
CCBot „Common Crawl“ korpusas, kuriuo remiasi daugelis modelių
„Google-Extended“ „Google“ „Gemini“ mokymas, ne paieška
„Applebot-Extended“ „Apple“ mokymas
„Bytespider“ „ByteDance“ mokymas
meta-išorinis agentas Meta mokymas

Rezultatai

77 % šių domenų leidžia visus AI agentus. 23 % blokuoja bent vieną.

Agentas Užblokuotas Domenai, kuriuose jis aiškiai paminėtas
Bytespider 20 % 45
CCBot 20 % 47
ClaudeBot 17 % 50
„Google-Extended“ 16 % 46
meta-externalagent 16 % 38
PerplexityBot 15 % 44
GPTBot 14 % 53
Applebot-Extended 14 % 39
„Amazonbot“ 13 % 39
Claude-SearchBot 10 % 22
DuckAssistBot 10 % 24
OAI-SearchBot 9 % 34

Mažiausiai dažnai blokuojamas agentas yra tas, kuris gauna puslapius, kuriuos „ChatGPT“ naudoja citatoms. Dažniausiai blokuojami agentai yra tie, kurie renka duomenis mokymo korpusams.

Susipažinkite su "Ranktracker

Efektyvaus SEO "viskas viename" platforma

Už kiekvieno sėkmingo verslo slypi stipri SEO kampanija. Tačiau turint daugybę optimizavimo priemonių ir metodų, iš kurių galima rinktis, gali būti sunku žinoti, nuo ko pradėti. Na, nebijokite, nes turiu ką padėti. Pristatome "Ranktracker" "viskas viename" platformą, skirtą efektyviam SEO

Pagaliau pradėjome registruotis į "Ranktracker" visiškai nemokamai!

Sukurti nemokamą paskyrą

Arba Prisijunkite naudodami savo įgaliojimus

Tokia tvarka nėra atsitiktinė, ir tai yra pagrindinė išvada.

Niekas nedaro klaidos. Visi priima sprendimą

Pažvelkite į du operatorius, kurie naudoja tiek mokymo, tiek paieškos robotus.

Blokuoja abu Blokuoja mokymą, leidžia atlikti paiešką Blokuoja paiešką, leidžia mokymą
OpenAI, GPTBot / OAI-SearchBot 9 % 5 % 0 %
Anthropic, ClaudeBot / Claude-SearchBot 10 % 7 % 0

Dvylika domenų blokuoja „GPTBot“, o „OAI-SearchBot“ sąmoningai leidžia. Penkiolika domenų elgiasi taip pat su „Anthropic“. Tai nuosekli politika: nemokykitės naudodami mano turinį, bet cituokite mane.

Niekas nedaro atvirkščiai.

Dar du skaičiai rodo tą pačią tendenciją. Tik keturi domenai iš visos imties naudoja visuotinį „User-agent: *“ draudimą, o tik vienas blokuoja AI agentą, aiškiai nenurodydamas jokio konkretaus AI agento. Kas redaguoja šiuos failus, tas žino, kokie agentai egzistuoja ir ką kiekvienas iš jų daro.

Taigi pramonės įspėjimas skirtas problemai, kurios šiame imtyje nėra. Įdomus klausimas yra ne tai, ar jūs užblokavote paieškos agentus netyčia, o tai, ar tai padarėte sąmoningai.

Nes 18 % šių domenų blokuoja bent vieną paieškos agentą, o 4 % – visus keturis. Šios svetainės atsisakė galimybės būti rodomos AI atsakymuose, ir, remiantis šiais duomenimis, jos tai padarė sąmoningai.

5 būdai, kaip tai ištaisyti jau šiandien

  1. Laikykite mokymą ir paiešką dviem atskirais klausimais. Tai skirtingi sprendimai, ir rinka juos jau atskyrė. Dauguma leidėjų nori antrojo be pirmojo. Parašykite failą būtent taip, o ne traktuokite „AI paieškos robotus“ kaip vieną kategoriją.

  2. Kiekvieną agentą pavadinkite aiškiai. Čia tik keturi domenai naudoja pakaitinį simbolį, ir tam yra rimta priežastis: paprastas „User-agent: * disallow“ užblokuoja agentus, kurių nebuvo tuo metu, kai jį rašėte, ir užblokuos agentus, kurių dar nėra. Du iš labiausiai blokuojamų agentų šiose rezultatų lentelėse – „Bytespider“ ir „meta-externalagent“ – atsirado vėliau nei dauguma vis dar paplitusių „robots.txt“ rekomendacijų.

  3. Patikrinkite „OAI-SearchBot“ ir „Claude-SearchBot“ pagal pavadinimą. Šie du agentai nusprendžia, ar jūsų turinys gali būti cituojamas. Devyni ir dešimt procentų tiriamųjų juos blokuoja. Jei esate toje grupėje, nors to nenorėjote, būtent šią eilutę reikia pakeisti, ir tai vienintelis šio sąrašo punktas, turintis tiesioginį poveikį matomumui.

  4. Atlikite pakartotinį auditą kas ketvirtį. Per pastaruosius metus keletą kartų pasirodė nauji agentai. Prieš aštuoniolika mėnesių sukurtame faile trūksta įrašų, nesvarbu, kaip kruopščiai jis tuo metu buvo parengtas.

  5. Patikrinkite ne tik pačiame faile, bet ir jo ribose. Jūsų CDN botų valdymo taisyklės gali blokuoti agentą, kurį „robots.txt“ aiškiai leidžia, o failas apie tai jums nieko nepasakys. Tai yra klaida, kuri išlieka net ir turint tobulą „robots.txt“ failą.

Išeities taškas, kuris atskiria šiuos du sprendimus:

# Cituokite mane. Šie agentai gauna puslapius, kuriuos cituoja tiesioginiuose atsakymuose.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Susipažinkite su "Ranktracker

Efektyvaus SEO "viskas viename" platforma

Už kiekvieno sėkmingo verslo slypi stipri SEO kampanija. Tačiau turint daugybę optimizavimo priemonių ir metodų, iš kurių galima rinktis, gali būti sunku žinoti, nuo ko pradėti. Na, nebijokite, nes turiu ką padėti. Pristatome "Ranktracker" "viskas viename" platformą, skirtą efektyviam SEO

Pagaliau pradėjome registruotis į "Ranktracker" visiškai nemokamai!

Sukurti nemokamą paskyrą

Arba Prisijunkite naudodami savo įgaliojimus

User-agent: DuckAssistBot Allow: /

Nenaudokite manęs mokymui. Jei nesutinkate, pakeiskite šiuos į „Allow“.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Tai beveik atitinka konfigūraciją, kurią jau naudoja dvylika–penkiolika šio pavyzdžio domenų. Dabar tai yra labiau įprasta pozicija, o ne išmintinga.

Kodėl nė viena iš šių nuorodų neatsiranda jūsų jau vykdomose ataskaitose

„Search Console“ ataskaitose pateikiami „Googlebot“ duomenys. Apie „OAI-SearchBot“ ten nieko nerašoma. „Analytics“ ataskaitose pateikiami sesijų duomenys, o paieškos sistema, kuri niekada nenurodo jūsų svetainės, nesiunčia jokių sesijų, todėl jų ir trūksta. Pozicijų stebėjimo įrankiai pateikia pozicijas, o jūsų pozicijoms visa tai neturi jokios įtakos.

Susipažinkite su "Ranktracker

Efektyvaus SEO "viskas viename" platforma

Už kiekvieno sėkmingo verslo slypi stipri SEO kampanija. Tačiau turint daugybę optimizavimo priemonių ir metodų, iš kurių galima rinktis, gali būti sunku žinoti, nuo ko pradėti. Na, nebijokite, nes turiu ką padėti. Pristatome "Ranktracker" "viskas viename" platformą, skirtą efektyviam SEO

Pagaliau pradėjome registruotis į "Ranktracker" visiškai nemokamai!

Sukurti nemokamą paskyrą

Arba Prisijunkite naudodami savo įgaliojimus

Yra du būdai tai pastebėti. Perskaityti failą tiesiogiai – būtent taip buvo padaryta šio tyrimo metu. Arba eiti atgal nuo simptomo, naudodami AI matomumo tikrintuvą, pagal grafiką užduodant paieškos sistemoms jūsų kategorijai būdingus klausimus ir stebint, ar neatsiras atsakymas, kad jos jūsų visiškai nemato.

Šio tyrimo pagrindą sudarantis paieškos robotų auditas yra tas, kurį atliekame „Honeyb“ – pagal grafiką, o ne vienkartiniu būdu, lygindami kiekvieną aukščiau pateiktame kataloge nurodytą agentą su svetainės „robots.txt“ taisyklėmis. Prieiga yra pirmasis iš keturių dalykų, kuriuos jis tikrina. Kiti trys – ar paieškos sistemos jus rekomenduoja, ką konkrečiai reikia pakeisti, ir tada – pakeitimus atspindinčio turinio sukūrimas bei paskelbimas.

Dvi ribos, kurias verta paminėti

Ši imtis sudaryta iš JAV komercinių paieškos rezultatų puslapių (SERP), todėl ji yra šališka didelių leidėjų ir pripažintų prekių ženklų atžvilgiu, kurie turi tiek žinių, tiek teisinę pagalbą, kad galėtų priimti apgalvotą sprendimą šiuo klausimu. Mažų įmonių svetainių imtis greičiausiai atrodytų kitaip, ir ten atsitiktinio blokavimo istorija galėtų pasirodyti esanti tiesa. Tai mes ištirtume kitą kartą.

Be to, „robots.txt“ failas fiksuoja ketinimus, o ne priverstinį vykdymą. Mes netikrinome, ar šie domenai iš tiesų pateikia turinį kiekvienam agentui – būtent čia galioja CDN taisyklės ir čia dažniausiai atsiranda atotrūkis tarp failo ir realybės.

Šio tyrimo platforma yra honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Pradėkite naudoti "Ranktracker"... nemokamai!

Sužinokite, kas trukdo jūsų svetainei užimti aukštesnes pozicijas.

Sukurti nemokamą paskyrą

Arba Prisijunkite naudodami savo įgaliojimus

Different views of Ranktracker app