• Teknologi

Cara mengumpulkan data web dalam skala besar tanpa diblokir

  • Valentin Ghita
  • 6 min read

Pendahuluan

Scraper Anda berfungsi dengan baik pada beberapa ratus halaman. Namun, saat diarahkan ke beberapa ratus ribu halaman, setengah dari permintaan Anda akan ditanggapi dengan kode 403, CAPTCHA, atau halaman kosong. Parser-nya tidak gagal. Situs target menyadari bahwa lalu lintas Anda tidak berperilaku seperti manusia, dan mulai melakukan tindakan pencegahan.

Scraping dalam skala besar pada dasarnya adalah permainan agar tidak mencolok. Setiap situs yang layak di-scraping menjalankan beberapa bentuk deteksi bot, dan setiap permintaan tambahan merupakan peluang lain untuk ditandai. Anda dapat mengatasinya dengan menerapkan dasar-dasar yang dilakukan dengan baik: proxy web scraping yang tepat, pengaturan kecepatan permintaan yang wajar, permintaan yang terlihat seperti browser asli, dan rencana jika situs tersebut melakukan perlawanan. Artikel ini memetakan bagaimana pemblokiran sebenarnya terjadi dan cara membangun alur kerja yang terus mengumpulkan data tanpa memicu setiap peringatan.

Mengapa situs memblokir pengumpulan data otomatis

Situs tidak memblokir pengikis data hanya untuk mempersulit. Mereka memblokir karena lalu lintas Anda menghabiskan uang mereka dan membocorkan data yang lebih baik disimpan. Satu pengikis data yang agresif dapat mengirimkan ribuan permintaan per menit, membebani server, dan memutarbalikkan analisis. Harga, daftar produk, dan ulasan adalah hal-hal yang sangat diinginkan pesaing, sehingga situs yang menyimpan data tersebut melindunginya dengan sangat ketat. Anggaplah target Anda telah bersiap menghadapi orang-orang seperti Anda.

Bagaimana sistem pemblokiran mengambil keputusan

Pemblokiran jarang didasarkan pada satu aturan saja. Sebagian besar sistem pertahanan mencatat skor secara terus-menerus untuk setiap pengunjung, dan melampaui batas tertentu akan membuat Anda diminta mengisi CAPTCHA atau ditolak aksesnya. Skor tersebut menjawab tiga pertanyaan: siapa Anda, seberapa cepat Anda bergerak, dan seperti apa penampilan Anda dari dekat.

Siapa Anda ditentukan oleh reputasi IP: rentang pusat data yang dikenal, atau alamat yang pernah berperilaku buruk sebelumnya, sudah memiliki catatan negatif sejak awal. Seberapa cepat Anda bergerak ditentukan oleh laju permintaan. Seperti apa penampilan Anda ditentukan oleh sidik jari Anda, yaitu header yang Anda kirim ditambah proses handshake TLS, yang mengungkap apakah yang mengakses adalah browser asli atau sekadar skrip.

Cloudflare dan Akamai menggabungkan ketiga faktor tersebut menjadi skor real-time per permintaan. Itulah sebabnya mengapa satu scraper dapat meluncur mulus melalui situs kecil namun menabrak tembok pada situs yang dilindungi yang menjalankan kode yang sama.

Membangun kumpulan proxy untuk skalabilitas

Mulailah dengan memahami diri Anda sendiri, karena satu alamat IP tidak mampu menangani tugas besar. Kirim seratus ribu permintaan dari satu alamat, dan Anda akan segera memicu pemeriksaan reputasi. Kumpulan proxy menyebarkan beban tersebut ke banyak alamat IP sehingga tidak ada yang menonjol; ini merupakan lapisan dasar dari setiap pengaturan pengumpulan data berskala besar. Proxy web scraping yang Anda pilih di sini menentukan batas atas untuk semua proses selanjutnya.

Building a proxy pool for scale

Di situs dengan perlindungan lemah atau tanpa perlindungan sama sekali, IP pusat data yang menangani beban berat: murah, cepat, dan tersedia dalam jumlah besar. Untuk pekerjaan bervolume tinggi, Anda membutuhkan IP pusat data yang dirancang khusus untuk pengumpulan data bervolume tinggi, bukan beberapa alamat bersama yang cepat habis dalam sehari. Masalahnya, alamat-alamat ini mudah terdeteksi. Proksi pusat data mencapai tingkat keberhasilan 60 hingga 90 persen pada target yang tidak terlindungi, lalu turun menjadi 20 hingga 40 persen saat menghadapi sistem manajemen bot Cloudflare atau Akamai, menurut TorchProxies (2026).

Perkenalkan Ranktracker

Platform Lengkap untuk SEO yang Efektif

Di balik setiap bisnis yang sukses adalah kampanye SEO yang kuat. Namun dengan banyaknya alat dan teknik pengoptimalan yang dapat dipilih, mungkin sulit untuk mengetahui dari mana harus memulai. Nah, jangan takut lagi, karena saya punya hal yang tepat untuk membantu. Menghadirkan platform lengkap Ranktracker untuk SEO yang efektif

Kami akhirnya membuka pendaftaran ke Ranktracker secara gratis!

Buat akun gratis

Atau Masuk menggunakan kredensial Anda

Penentuan ukuran adalah soal perhitungan: jika sebuah situs dapat menampung sekitar 10 permintaan per IP per menit dan Anda membutuhkan 6.000, berarti dibutuhkan minimal 600 IP bersih, ditambah ruang cadangan untuk yang terdeteksi.

Logika pengaturan kecepatan permintaan dan rotasi

Selanjutnya adalah seberapa cepat Anda bergerak. Rotasi menentukan IP mana yang menangani setiap permintaan; pengaturan kecepatan menentukan jeda di antara permintaan-permintaan tersebut.

Request pacing and rotation logic

Rotasi per permintaan memberikan IP baru untuk setiap panggilan, yang cocok untuk pekerjaan tanpa status seperti halaman produk independen. Sesi tetap mempertahankan satu IP selama serangkaian permintaan terkait, yang diperlukan ketika sebuah situs melacak sesi, seperti saat checkout.

Pengaturan kecepatan adalah faktor yang menentukan apakah pengguna dapat menghindari pemblokiran saat melakukan scraping atau justru langsung terjebak di dalamnya. Acak jeda antara permintaan, karena jeda tetap 200 ms itu sendiri sudah menjadi sinyal bot. Batasi laju per IP dan tambahkan penundaan eksponensial, sehingga kesalahan membuat Anda melambat alih-alih memaksakan diri. Bagan di atas menunjukkan alasannya: tingkat pemblokiran mendekati nol hingga Anda melampaui toleransi target, lalu melonjak. Panduan Ranktracker tentang pengikisan web untuk alat SEO menunjukkan bagaimana pengaturan kecepatan yang sama menjaga akurasi pelacak peringkat.

Header dan sidik jari

Yang terakhir adalah penampilan Anda. Alamat IP bersih dengan kecepatan yang wajar tetap bisa terdeteksi jika permintaan itu sendiri terlihat seperti skrip. Setiap permintaan membawa header dan sidik jari TLS, dan sistem deteksi membandingkan keduanya dengan browser asli.

Mulailah dengan User-Agent, tetapi jangan berhenti di situ. Browser asli mengirimkan sekumpulan header Accept, Accept-Language, dan Accept-Encoding yang sesuai dalam urutan yang konsisten, dan permintaan yang melewatkan header-header tersebut atau mengacak urutannya akan mencolok. Di baliknya terdapat proses handshake TLS, yang diringkas menjadi sidik jari JA3. Klien Python dan Chrome melakukan handshake secara berbeda meskipun header yang terlihat sama, sehingga sistem anti-bot yang kuat membaca handshake tersebut untuk mendeteksi scraper yang hanya memalsukan tampilan luarnya. Pastikan setiap permintaan terlihat seperti berasal dari browser dari awal hingga akhir.

Menangani CAPTCHA dan pemblokiran lunak

Tidak semua pemblokiran menampilkan tanda yang jelas. Pemblokiran keras mudah dikenali: layar CAPTCHA atau kode status 403. Pemblokiran lunak tersembunyi. Situs mengembalikan kode status 200, tetapi isi respons dibatasi, diencerkan, atau disisipi data salah yang dimaksudkan untuk merusak dataset Anda tanpa pemberitahuan.

Deteksi adalah prioritas utama. Tandai respons yang kembali dengan ukuran mencurigakan kecil, atau identik di halaman-halaman yang seharusnya berbeda, dan anggap sebagai kegagalan meskipun statusnya menunjukkan keberhasilan. Masukan yang buruk merusak segala sesuatu yang dibangun di atasnya, sehingga pemeriksaan kualitas data sama pentingnya dengan akses. Panduan Ranktracker untuk pelacakan peringkat yang akurat menunjukkan bagaimana masukan yang berisik merusak angka-angka yang Anda laporkan.

Perkenalkan Ranktracker

Platform Lengkap untuk SEO yang Efektif

Di balik setiap bisnis yang sukses adalah kampanye SEO yang kuat. Namun dengan banyaknya alat dan teknik pengoptimalan yang dapat dipilih, mungkin sulit untuk mengetahui dari mana harus memulai. Nah, jangan takut lagi, karena saya punya hal yang tepat untuk membantu. Menghadirkan platform lengkap Ranktracker untuk SEO yang efektif

Kami akhirnya membuka pendaftaran ke Ranktracker secara gratis!

Buat akun gratis

Atau Masuk menggunakan kredensial Anda

Saat CAPTCHA muncul, memang ada layanan pemecahannya, tetapi solusi yang lebih murah adalah dari hulu: perlambat laju, lakukan rotasi lebih sering, bersihkan sidik jari, dan Anda tidak akan lagi menerima tantangan tersebut.

Kapan harus beralih ke tier perumahan

Terkadang tingkatan IP itu sendiri menjadi batasan. Ketika sistem manajemen bot terus memblokir kumpulan IP pusat data Anda, terlepas seberapa baik Anda mengatur kecepatan dan menyamarkan lalu lintas, itulah tanda bagi Anda untuk beralih ke tingkat yang lebih tinggi.

Perkenalkan Ranktracker

Platform Lengkap untuk SEO yang Efektif

Di balik setiap bisnis yang sukses adalah kampanye SEO yang kuat. Namun dengan banyaknya alat dan teknik pengoptimalan yang dapat dipilih, mungkin sulit untuk mengetahui dari mana harus memulai. Nah, jangan takut lagi, karena saya punya hal yang tepat untuk membantu. Menghadirkan platform lengkap Ranktracker untuk SEO yang efektif

Kami akhirnya membuka pendaftaran ke Ranktracker secara gratis!

Buat akun gratis

Atau Masuk menggunakan kredensial Anda

IP residensial berasal dari perangkat rumah tangga asli, sehingga memiliki tingkat kepercayaan yang tidak pernah dimiliki oleh rentang IP pusat data. Untuk target yang sulit ditembus, beralih ke IP residensial yang berganti-ganti akan memberikan lalu lintas yang terlihat seperti pengguna rumahan biasa, sehingga dapat melewati filter yang langsung menolak alamat pusat data.

Harganya adalah kecepatan dan biaya. Proksi pusat data berjalan 3 hingga 10 kali lebih cepat, sekitar di bawah 200 ms dibandingkan 500 ms hingga 2 detik untuk proksi perumahan, menurut ProxyWing. Pada jutaan permintaan, hal ini akan bertambah, jadi atur prioritasnya: jadikan proksi pusat data sebagai default dan alihkan hanya permintaan yang diblokir ke proksi perumahan.

When to escalate to residential

Hasil pencarian adalah contoh klasiknya. Jika Anda melakukan scraping pada SERP untuk memasok data ke alat seperti SERP Checker dari Ranktracker, halaman-halaman yang paling sulit sering kali akan mengalihkan Anda ke proxy perumahan.

Uji pada satu target sebelum Anda memperluas skala

Sebelum Anda mengarahkan scraper ke seluruh daftar target, jalankan terlebih dahulu pada satu situs yang dilindungi dan perhatikan kode responsnya. Mulailah dengan kumpulan server data yang kecil, atur kecepatannya secara konservatif, lalu tingkatkan laju hingga muncul pemblokiran, lalu mundur ke tingkat terakhir yang masih lancar. Angka tersebut adalah batas maksimum per IP, dan angka itulah yang menentukan ukuran kumpulan server data untuk seluruh pekerjaan. Pastikan pengaturan proxy dan kecepatan pengikisan web Anda tepat pada satu situs, dan pengaturan yang sama dapat diterapkan ke situs lainnya.

Pertanyaan yang Sering Diajukan

Berapa banyak proxy yang saya butuhkan untuk melakukan pengikisan data dalam skala besar?

Tergantung pada toleransi target dan throughput Anda. Hitung berapa banyak permintaan per menit yang dapat ditangani oleh satu IP sebelum ditandai, bagi laju target Anda dengan angka tersebut, lalu tambahkan buffer. Butuh 6.000 permintaan per menit untuk situs yang mentoleransi 10 permintaan per IP? Itu berarti Anda membutuhkan lebih dari 600 IP bersih, bukan segelintir IP yang dipaksa bekerja berlebihan.

Manakah yang lebih baik untuk web scraping: proxy pusat data atau proxy residensial?

Tidak ada yang menang mutlak. Proksi pusat data lebih cepat dan lebih murah serta dapat menangani situs yang tidak terlindungi dengan baik. Proksi perumahan lebih lambat dan lebih mahal, tetapi dapat bertahan dari manajemen bot yang ketat. Sebagian besar pipeline menjalankan keduanya, menggunakan proksi pusat data sebagai default, dan beralih ke proksi perumahan hanya jika pemblokiran memaksa hal tersebut.

Mengapa saya masih diblokir meskipun menggunakan proxy?

Biasanya karena pembatasan kecepatan atau sidik jari, bukan karena IP. Gunakan kumpulan proxy yang besar, tetapi jalankan dengan kecepatan mesin menggunakan header default, dan pola tersebut tetap terlihat. Perlambat kecepatan, acak, dan tampil seperti browser terlebih dahulu.

Apakah pengumpulan data publik diperbolehkan?

Ini merupakan wilayah abu-abu secara hukum yang bergantung pada yurisdiksi Anda dan ketentuan layanan situs tersebut. Batasi diri pada data yang terlihat publik, patuhi robots.txt jika memungkinkan, hindari data pribadi, dan dapatkan nasihat hukum sebelum melakukan pengambilan data komersial dalam skala besar.

Valentin Ghita

Valentin Ghita

technical writing

handles technical writing, marketing, and research at Anonymous Proxies (anonymous-proxies.net). He writes about proxies, web data, and the technical side of digital marketing.

Mulai gunakan Ranktracker... Gratis!

Cari tahu apa yang menghambat situs web Anda untuk mendapatkan peringkat.

Buat akun gratis

Atau Masuk menggunakan kredensial Anda

Different views of Ranktracker app