Įvadas
Kiekviename straipsnyje apie AI paieškos robotus įspėjama apie tą pačią klaidą. Įspėjime teigiama, kad per 2023 m. duomenų rinkimo paniką užblokavote „GPTBot“, o kartu netyčia užblokavote ir naujesnius agentus, kurie renka puslapius, kad galėtų juos cituoti tiesioginiuose atsakymuose. Jūs norėjote sustabdyti mokymo paieškos robotus, bet tyliai atsisakėte galimybės būti rekomenduojamiems.
Mes patikrinome, ar tai iš tiesų vyksta.
Iš 219 domenų tai neįvyko nė karto.
Ne retai. Ne keliuose atvejais. Nei vieno karto.
Metodika
Išrinkome dvidešimt populiariausių natūrinių paieškos rezultatų pagal 26 komercinius užklausimus septyniose kategorijose: SaaS, elektroninė prekyba, finansai, sveikata, kelionės, namai ir rinkodara. Taip gavome 254 unikalius domenus. 2026 m. liepos 28 d. iš kiekvieno iš jų atsisiuntėme „robots.txt“ failą, ir 219 iš jų buvo sėkmingai išspręsti. Septyni iš jų visai nepateikė „robots.txt“ failo, o tai reiškia, kad leidžiama viskas.
Kiekvienam domenui patikrinome kiekvieną AI vartotojo agentą pagal šį failą, taikydami standartinę pirmenybės taisyklę: laimi labiausiai konkretus atitinkantis „User-agent“ grupės elementas, taigi tiksliai atitinkantis agentas turi pirmenybę prieš „*“. Laikoma, kad domenas blokuoja agentą, kai jo laimėjusi grupė neleidžia patekti į svetainės šaknį be konkretesnio leidimo.
Buvo patikrinti dvylika agentų, suskirstytų pagal tai, ką jie pateikia.
| Agentas | Operatorius | Srautas |
| GPTBot | OpenAI | mokymas |
| OAI-SearchBot | OpenAI | „ChatGPT“ paieškos citatos |
| ClaudeBot | Anthropic | mokymas |
| Claude-SearchBot | Anthropic | Claude paieškos citatos |
| PerplexityBot | Perplexity | atsakymai |
| DuckAssistBot | DuckDuckGo | atsakymai |
| Amazonbot | „Amazon“ | atsakymai |
| CCBot | „Common Crawl“ | korpusas, kuriuo remiasi daugelis modelių |
| „Google-Extended“ | „Google“ | „Gemini“ mokymas, ne paieška |
| „Applebot-Extended“ | „Apple“ | mokymas |
| „Bytespider“ | „ByteDance“ | mokymas |
| meta-išorinis agentas | Meta | mokymas |
Rezultatai
77 % šių domenų leidžia visus AI agentus. 23 % blokuoja bent vieną.
| Agentas | Užblokuotas | Domenai, kuriuose jis aiškiai paminėtas |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| „Google-Extended“ | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| „Amazonbot“ | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Mažiausiai dažnai blokuojamas agentas yra tas, kuris gauna puslapius, kuriuos „ChatGPT“ naudoja citatoms. Dažniausiai blokuojami agentai yra tie, kurie renka duomenis mokymo korpusams.
Efektyvaus SEO "viskas viename" platforma
Už kiekvieno sėkmingo verslo slypi stipri SEO kampanija. Tačiau turint daugybę optimizavimo priemonių ir metodų, iš kurių galima rinktis, gali būti sunku žinoti, nuo ko pradėti. Na, nebijokite, nes turiu ką padėti. Pristatome "Ranktracker" "viskas viename" platformą, skirtą efektyviam SEO
Pagaliau pradėjome registruotis į "Ranktracker" visiškai nemokamai!
Sukurti nemokamą paskyrąArba Prisijunkite naudodami savo įgaliojimus
Tokia tvarka nėra atsitiktinė, ir tai yra pagrindinė išvada.
Niekas nedaro klaidos. Visi priima sprendimą
Pažvelkite į du operatorius, kurie naudoja tiek mokymo, tiek paieškos robotus.
| Blokuoja abu | Blokuoja mokymą, leidžia atlikti paiešką | Blokuoja paiešką, leidžia mokymą | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 % |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Dvylika domenų blokuoja „GPTBot“, o „OAI-SearchBot“ sąmoningai leidžia. Penkiolika domenų elgiasi taip pat su „Anthropic“. Tai nuosekli politika: nemokykitės naudodami mano turinį, bet cituokite mane.
Niekas nedaro atvirkščiai.
Dar du skaičiai rodo tą pačią tendenciją. Tik keturi domenai iš visos imties naudoja visuotinį „User-agent: *“ draudimą, o tik vienas blokuoja AI agentą, aiškiai nenurodydamas jokio konkretaus AI agento. Kas redaguoja šiuos failus, tas žino, kokie agentai egzistuoja ir ką kiekvienas iš jų daro.
Taigi pramonės įspėjimas skirtas problemai, kurios šiame imtyje nėra. Įdomus klausimas yra ne tai, ar jūs užblokavote paieškos agentus netyčia, o tai, ar tai padarėte sąmoningai.
Nes 18 % šių domenų blokuoja bent vieną paieškos agentą, o 4 % – visus keturis. Šios svetainės atsisakė galimybės būti rodomos AI atsakymuose, ir, remiantis šiais duomenimis, jos tai padarė sąmoningai.
5 būdai, kaip tai ištaisyti jau šiandien
-
Laikykite mokymą ir paiešką dviem atskirais klausimais. Tai skirtingi sprendimai, ir rinka juos jau atskyrė. Dauguma leidėjų nori antrojo be pirmojo. Parašykite failą būtent taip, o ne traktuokite „AI paieškos robotus“ kaip vieną kategoriją.
-
Kiekvieną agentą pavadinkite aiškiai. Čia tik keturi domenai naudoja pakaitinį simbolį, ir tam yra rimta priežastis: paprastas „User-agent: * disallow“ užblokuoja agentus, kurių nebuvo tuo metu, kai jį rašėte, ir užblokuos agentus, kurių dar nėra. Du iš labiausiai blokuojamų agentų šiose rezultatų lentelėse – „Bytespider“ ir „meta-externalagent“ – atsirado vėliau nei dauguma vis dar paplitusių „robots.txt“ rekomendacijų.
-
Patikrinkite „OAI-SearchBot“ ir „Claude-SearchBot“ pagal pavadinimą. Šie du agentai nusprendžia, ar jūsų turinys gali būti cituojamas. Devyni ir dešimt procentų tiriamųjų juos blokuoja. Jei esate toje grupėje, nors to nenorėjote, būtent šią eilutę reikia pakeisti, ir tai vienintelis šio sąrašo punktas, turintis tiesioginį poveikį matomumui.
-
Atlikite pakartotinį auditą kas ketvirtį. Per pastaruosius metus keletą kartų pasirodė nauji agentai. Prieš aštuoniolika mėnesių sukurtame faile trūksta įrašų, nesvarbu, kaip kruopščiai jis tuo metu buvo parengtas.
-
Patikrinkite ne tik pačiame faile, bet ir jo ribose. Jūsų CDN botų valdymo taisyklės gali blokuoti agentą, kurį „robots.txt“ aiškiai leidžia, o failas apie tai jums nieko nepasakys. Tai yra klaida, kuri išlieka net ir turint tobulą „robots.txt“ failą.
Išeities taškas, kuris atskiria šiuos du sprendimus:
# Cituokite mane. Šie agentai gauna puslapius, kuriuos cituoja tiesioginiuose atsakymuose.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Susipažinkite su "RanktrackerEfektyvaus SEO "viskas viename" platforma
Už kiekvieno sėkmingo verslo slypi stipri SEO kampanija. Tačiau turint daugybę optimizavimo priemonių ir metodų, iš kurių galima rinktis, gali būti sunku žinoti, nuo ko pradėti. Na, nebijokite, nes turiu ką padėti. Pristatome "Ranktracker" "viskas viename" platformą, skirtą efektyviam SEO
Pagaliau pradėjome registruotis į "Ranktracker" visiškai nemokamai!
Sukurti nemokamą paskyrąArba Prisijunkite naudodami savo įgaliojimus
User-agent: DuckAssistBot
Allow: /
Nenaudokite manęs mokymui. Jei nesutinkate, pakeiskite šiuos į „Allow“.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Tai beveik atitinka konfigūraciją, kurią jau naudoja dvylika–penkiolika šio pavyzdžio domenų. Dabar tai yra labiau įprasta pozicija, o ne išmintinga.
Kodėl nė viena iš šių nuorodų neatsiranda jūsų jau vykdomose ataskaitose
„Search Console“ ataskaitose pateikiami „Googlebot“ duomenys. Apie „OAI-SearchBot“ ten nieko nerašoma. „Analytics“ ataskaitose pateikiami sesijų duomenys, o paieškos sistema, kuri niekada nenurodo jūsų svetainės, nesiunčia jokių sesijų, todėl jų ir trūksta. Pozicijų stebėjimo įrankiai pateikia pozicijas, o jūsų pozicijoms visa tai neturi jokios įtakos.
Efektyvaus SEO "viskas viename" platforma
Už kiekvieno sėkmingo verslo slypi stipri SEO kampanija. Tačiau turint daugybę optimizavimo priemonių ir metodų, iš kurių galima rinktis, gali būti sunku žinoti, nuo ko pradėti. Na, nebijokite, nes turiu ką padėti. Pristatome "Ranktracker" "viskas viename" platformą, skirtą efektyviam SEO
Pagaliau pradėjome registruotis į "Ranktracker" visiškai nemokamai!
Sukurti nemokamą paskyrąArba Prisijunkite naudodami savo įgaliojimus
Yra du būdai tai pastebėti. Perskaityti failą tiesiogiai – būtent taip buvo padaryta šio tyrimo metu. Arba eiti atgal nuo simptomo, naudodami AI matomumo tikrintuvą, pagal grafiką užduodant paieškos sistemoms jūsų kategorijai būdingus klausimus ir stebint, ar neatsiras atsakymas, kad jos jūsų visiškai nemato.
Šio tyrimo pagrindą sudarantis paieškos robotų auditas yra tas, kurį atliekame „Honeyb“ – pagal grafiką, o ne vienkartiniu būdu, lygindami kiekvieną aukščiau pateiktame kataloge nurodytą agentą su svetainės „robots.txt“ taisyklėmis. Prieiga yra pirmasis iš keturių dalykų, kuriuos jis tikrina. Kiti trys – ar paieškos sistemos jus rekomenduoja, ką konkrečiai reikia pakeisti, ir tada – pakeitimus atspindinčio turinio sukūrimas bei paskelbimas.
Dvi ribos, kurias verta paminėti
Ši imtis sudaryta iš JAV komercinių paieškos rezultatų puslapių (SERP), todėl ji yra šališka didelių leidėjų ir pripažintų prekių ženklų atžvilgiu, kurie turi tiek žinių, tiek teisinę pagalbą, kad galėtų priimti apgalvotą sprendimą šiuo klausimu. Mažų įmonių svetainių imtis greičiausiai atrodytų kitaip, ir ten atsitiktinio blokavimo istorija galėtų pasirodyti esanti tiesa. Tai mes ištirtume kitą kartą.
Be to, „robots.txt“ failas fiksuoja ketinimus, o ne priverstinį vykdymą. Mes netikrinome, ar šie domenai iš tiesų pateikia turinį kiekvienam agentui – būtent čia galioja CDN taisyklės ir čia dažniausiai atsiranda atotrūkis tarp failo ir realybės.
Šio tyrimo platforma yra honeyb.ai.

