Pendahuluan
Setiap artikel tentang crawler AI memperingatkan Anda tentang kesalahan yang sama. Anda memblokir GPTBot selama kepanikan scraping tahun 2023, demikian bunyi peringatannya, dan tanpa sengaja Anda juga memblokir agen-agen baru yang mengambil halaman untuk dikutip dalam jawaban langsung. Anda bermaksud menghentikan scraper pelatihan dan tanpa disadari Anda memilih untuk tidak direkomendasikan.
Kami memeriksa apakah hal itu benar-benar terjadi.
Di 219 domain, hal itu tidak pernah terjadi sama sekali.
Bukan sesekali. Bukan dalam beberapa kasus. Bukan sekali pun.
Metode
Kami mengambil 20 hasil organik teratas untuk 26 kueri komersial di tujuh kategori: SaaS, e-commerce, keuangan, kesehatan, perjalanan, rumah, dan pemasaran. Hal ini menghasilkan 254 domain unik. Kami mengambil file robots.txt untuk masing-masing domain pada 28 Juli 2026, dan 219 di antaranya berhasil diakses. Tujuh di antaranya tidak menyertakan file robots.txt sama sekali, yang dianggap sebagai izin untuk mengakses semuanya.
Untuk setiap domain, kami memeriksa setiap agen pengguna AI terhadap berkas tersebut menggunakan aturan prioritas standar: kelompok User-agent yang paling spesifik menang, sehingga kecocokan agen yang tepat mengesampingkan *. Sebuah domain dianggap memblokir agen jika kelompok pemenangnya melarang akses ke akar situs tanpa izin yang lebih spesifik.
Dua belas agen telah diperiksa, dikelompokkan berdasarkan konten yang disajikan.
| Agen | Operator | Umpan |
| GPTBot | OpenAI | pelatihan |
| OAI-SearchBot | OpenAI | Kutipan pencarian ChatGPT |
| ClaudeBot | Anthropic | pelatihan |
| Claude-SearchBot | Anthropic | Kutipan pencarian Claude |
| PerplexityBot | Perplexity | jawaban |
| DuckAssistBot | DuckDuckGo | jawaban |
| Amazonbot | Amazon | jawaban |
| CCBot | Common Crawl | sebuah korpus yang menjadi sumber bagi banyak model |
| Google-Extended | Pelatihan Gemini, bukan Pencarian | |
| Applebot-Extended | Apple | pelatihan |
| Bytespider | ByteDance | pelatihan |
| meta-agen eksternal | Meta | pelatihan |
Hasil
77% dari domain ini mengizinkan setiap agen AI. Dua puluh tiga persen memblokir setidaknya satu.
| Agen | Diblokir | Domain yang menyebutnya secara eksplisit |
| Bytespider | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-Extended | 16% | 46 |
| meta-agen eksternal | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| Claude-SearchBot | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
Agen yang paling jarang diblokir adalah yang mengambil halaman untuk dikutip oleh ChatGPT. Agen yang paling sering diblokir adalah yang mengumpulkan data untuk korpus pelatihan.
Platform Lengkap untuk SEO yang Efektif
Di balik setiap bisnis yang sukses adalah kampanye SEO yang kuat. Namun dengan banyaknya alat dan teknik pengoptimalan yang dapat dipilih, mungkin sulit untuk mengetahui dari mana harus memulai. Nah, jangan takut lagi, karena saya punya hal yang tepat untuk membantu. Menghadirkan platform lengkap Ranktracker untuk SEO yang efektif
Kami akhirnya membuka pendaftaran ke Ranktracker secara gratis!
Buat akun gratisAtau Masuk menggunakan kredensial Anda
Urutan tersebut bukanlah kebetulan, dan itulah inti dari temuan ini.
Tidak ada yang melakukan kesalahan. Semua orang membuat keputusan
Perhatikan dua operator yang mengoperasikan baik crawler pelatihan maupun crawler pencarian.
| Memblokir keduanya | Memblokir pelatihan, mengizinkan pencarian | Memblokir pencarian, mengizinkan pelatihan | |
| OpenAI, GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic, ClaudeBot / Claude-SearchBot | 10% | 7% | 0 |
Dua belas domain memblokir GPTBot sambil secara sengaja mengizinkan OAI-SearchBot. Lima belas domain melakukan hal yang sama untuk Anthropic. Itu adalah kebijakan yang konsisten: jangan gunakan konten saya untuk pelatihan, tetapi silakan kutip saya.
Tidak ada yang melakukan sebaliknya.
Dua angka lainnya menunjukkan hal yang sama. Hanya empat domain di seluruh sampel yang menggunakan larangan menyeluruh User-agent: * root, dan tepat satu domain yang memblokir agen AI tanpa menyebut nama agen AI mana pun secara eksplisit. Siapa pun yang mengedit file-file ini tahu agen mana saja yang ada dan apa yang dilakukan masing-masing agen.
Jadi, peringatan industri tersebut membahas masalah yang, dalam sampel ini, tidak ada. Pertanyaan yang menarik bukanlah apakah Anda memblokir agen pencarian secara tidak sengaja. Melainkan apakah Anda melakukannya dengan sengaja.
Karena 18% dari domain ini memblokir setidaknya satu agen pencarian dan 4% memblokir keempatnya. Situs-situs tersebut telah memilih untuk tidak muncul dalam jawaban AI, dan berdasarkan bukti ini, mereka melakukannya dengan sengaja.
5 cara untuk memperbaikinya hari ini
-
Perlakukan pelatihan dan pencarian sebagai dua hal yang terpisah. Keduanya merupakan keputusan yang berbeda dan pasar telah memisahkannya. Sebagian besar penerbit menginginkan yang kedua tanpa yang pertama. Tulis file tersebut dengan cara itu daripada memperlakukan “AI crawler” sebagai satu kategori.
-
Sebutkan setiap agen secara eksplisit. Hanya empat domain di sini yang mengandalkan karakter wildcard, dan ada alasan yang kuat untuk itu: perintah User-agent: * disallow yang sederhana akan menangkap agen yang belum ada saat Anda menulisnya, dan akan menangkap agen yang belum ada di masa depan. Dua agen yang paling sering diblokir dalam hasil ini, Bytespider dan meta-externalagent, muncul setelah sebagian besar saran robots.txt yang masih beredar.
-
Periksa OAI-SearchBot dan Claude-SearchBot berdasarkan namanya. Kedua agen ini menentukan apakah situs Anda dapat dikutip. Sembilan dan sepuluh persen dari sampel memblokir keduanya. Jika Anda termasuk dalam kelompok tersebut dan tidak bermaksud demikian, inilah baris yang perlu diubah, dan ini adalah satu-satunya item dalam daftar ini yang berdampak langsung pada visibilitas.
-
Lakukan audit ulang setiap kuartal. Agen baru telah muncul beberapa kali dalam setahun terakhir. Berkas yang ditulis delapan belas bulan lalu pasti kehilangan entri, terlepas seberapa teliti penulisan berkas tersebut pada saat itu.
-
Lakukan verifikasi di tepi jaringan, bukan hanya di berkas tersebut. Aturan pengelolaan bot di CDN Anda dapat memblokir agen yang secara eksplisit diizinkan oleh robots.txt, dan berkas tersebut tidak akan memberi tahu Anda apa pun tentang hal itu. Inilah kegagalan yang tetap ada meskipun robots.txt sudah sempurna.
Titik awal yang membedakan kedua keputusan tersebut:
# Kutip saya. Agen-agen ini mengambil halaman untuk dikutip dalam jawaban langsung.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Perkenalkan RanktrackerPlatform Lengkap untuk SEO yang Efektif
Di balik setiap bisnis yang sukses adalah kampanye SEO yang kuat. Namun dengan banyaknya alat dan teknik pengoptimalan yang dapat dipilih, mungkin sulit untuk mengetahui dari mana harus memulai. Nah, jangan takut lagi, karena saya punya hal yang tepat untuk membantu. Menghadirkan platform lengkap Ranktracker untuk SEO yang efektif
Kami akhirnya membuka pendaftaran ke Ranktracker secara gratis!
Buat akun gratisAtau Masuk menggunakan kredensial Anda
User-agent: DuckAssistBot
Allow: /
Jangan gunakan saya untuk pelatihan. Ubah baris-baris ini menjadi Allow jika Anda tidak setuju.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Konfigurasi ini mirip dengan yang sudah diterapkan oleh dua belas hingga lima belas domain dalam contoh ini. Ini sudah menjadi praktik umum saat ini, bukan lagi sesuatu yang unik.
Mengapa hal ini tidak muncul dalam laporan yang sudah Anda jalankan
Search Console melaporkan Googlebot. Laporan tersebut tidak menyebutkan apa pun tentang OAI-SearchBot. Analytics melaporkan sesi, dan mesin pencari yang tidak pernah mengindeks situs Anda tidak mengirimkan sesi apa pun sehingga tidak ada yang hilang. Alat pelacak peringkat melaporkan posisi, dan posisi Anda tidak terpengaruh oleh hal ini.
Platform Lengkap untuk SEO yang Efektif
Di balik setiap bisnis yang sukses adalah kampanye SEO yang kuat. Namun dengan banyaknya alat dan teknik pengoptimalan yang dapat dipilih, mungkin sulit untuk mengetahui dari mana harus memulai. Nah, jangan takut lagi, karena saya punya hal yang tepat untuk membantu. Menghadirkan platform lengkap Ranktracker untuk SEO yang efektif
Kami akhirnya membuka pendaftaran ke Ranktracker secara gratis!
Buat akun gratisAtau Masuk menggunakan kredensial Anda
Ada dua cara untuk mendeteksinya. Membaca berkas secara langsung, seperti yang dilakukan dalam studi ini. Atau menelusuri dari gejala menggunakan alat pemeriksa visibilitas berbasis AI, dengan mengajukan pertanyaan kategori Anda kepada mesin pencari sesuai jadwal dan memantau jawaban yang menyatakan bahwa mereka sama sekali tidak dapat melihat situs Anda.
Audit crawler di balik studi ini adalah yang kami jalankan di Honeyb, yang mencocokkan setiap agen yang disebutkan dalam katalog di atas dengan aturan robots.txt situs secara terjadwal, bukan sekadar sekali saja. Akses adalah hal pertama dari empat hal yang diperiksa. Tiga hal lainnya adalah apakah mesin pencari merekomendasikan Anda, apa yang perlu diubah secara spesifik, dan kemudian membuat serta menerbitkan konten yang mengubahnya.
Dua batasan yang perlu disebutkan
Sampel ini berasal dari SERP komersial AS, sehingga cenderung condong ke penerbit besar dan merek mapan, yang memiliki kesadaran dan nasihat hukum untuk mengambil keputusan yang matang di sini. Sampel situs usaha kecil kemungkinan besar akan terlihat berbeda, dan kisah pemblokiran yang tidak disengaja mungkin benar-benar terjadi di sana. Kami akan menjalankan pengujian tersebut selanjutnya.
Selain itu, berkas robots.txt mencatat niat, bukan penegakan aturan. Kami tidak menguji apakah domain-domain ini benar-benar menyajikan konten kepada setiap agen, yang merupakan tempat aturan CDN berlaku dan di mana kesenjangan antara berkas dan kenyataan cenderung muncul.
Platform di balik studi ini adalah honeyb.ai.

