Yeni özelliğimize göz atın:Yapay Zeka Fiyat Analizini İnceleyin

Blog'a Dön

Kategori: Kazıma

Tek Bir Scraper Neden Yetmez? Anti-Bot, Proxy ve Çok Motorlu Veri Toplama

3 dk okumaYayın: 12 Ağustos 2026

Tek bir scraper neden yetmez? Senkrondata’nın statik ve tarayıcı tabanlı motorları, proxy rotasyonunu ve sağlık kontrolünü nasıl birleştirdiğini anlatıyoruz.

"Bir web sayfasından fiyat çekmek" ilk bakışta basit görünür: sayfayı indir, HTML'i ayrıştır, sayıyı al. Bir siteden birkaç ürün için bu doğrudur. Ama yüzlerce siteden, her gün, milyonlarca ürünü güvenilir biçimde çekmeye çalıştığınız an, tek bir yöntemin neden çöktüğünü anlarsınız.

Sorun teknik değil, düşmancadır: modern siteler kazınmak istemez ve buna karşı aktif olarak savunma yapar. Bu yüzden dayanıklı bir veri toplama altyapısı tek bir "scraper" değil, birbirini tamamlayan birkaç motorun ve tekniğin orkestrasyonudur.

İki tür sayfa iki tür motor: statik sayfalar hafif HTTP istemci ile, JS ile render edilen sayfalar headless tarayıcı ile toplanır
İki tür sayfa iki tür motor: statik sayfalar hafif HTTP istemci ile, JS ile render edilen sayfalar headless tarayıcı ile toplanır

İki tür sayfa, iki tür motor

Web'de iki farklı dünya vardır:

  • Statik / sunucu-render'lı sayfalar: fiyat doğrudan sunucudan gelen HTML içindedir. Bunları hafif, hızlı bir istek + ayrıştırma yaklaşımıyla (klasik HTTP istemcisi + HTML parser) toplamak en verimlisidir. Ölçeklenmesi ucuzdur.
  • JavaScript ile render'lanan sayfalar: fiyat, sayfa açıldıktan sonra tarayıcıda çalışan JavaScript tarafından yüklenir. Bunları görebilmek için gerçek bir tarayıcı motoru (headless Chromium gibi) çalıştırmak, sayfanın yüklenmesini beklemek, hatta bazen tıklama/kaydırma gibi etkileşimleri taklit etmek gerekir.

Tek bir yaklaşımı her siteye dayatmak iki yönden de kaybettirir: statik sayfaya tarayıcı motoru koşmak gereksiz pahalıdır; JS'li sayfaya hafif istemci koşmak ise boş HTML getirir. Bu yüzden Senkrondata altyapısında crawler'lar, hedef sitenin doğasına göre farklı motorlar (hafif istekten tam tarayıcıya) kullanır.

Neden engellenirsiniz: anti-bot savunmaları

Siteler, otomatik trafiği insan trafiğinden ayırmak için çok katmanlı savunmalar kullanır: IP başına hız limitleri, aynı adresten gelen yoğun isteklerin engellenmesi, tarayıcı parmak izi kontrolü, davranışsal analiz, CAPTCHA'lar. Naif bir scraper, aynı IP'den, aynı desende, insan-üstü hızla istek atarak kendini anında ele verir ve engellenir.

Dayanıklılık bu savunmalara saygılı ve dağıtık davranmaktan geçer:

  • Proxy rotasyonu: istekleri tek bir IP yerine bir havuz üzerinden dağıtmak, hem hız limitlerine takılmayı azaltır hem de tek bir adresin engellenmesinin tüm toplamayı durdurmasını önler.
Proxy rotasyonu: crawler istekleri tek bir IP yerine bir havuz üzerinden hedef siteye dağıtır
Proxy rotasyonu: crawler istekleri tek bir IP yerine bir havuz üzerinden hedef siteye dağıtır
  • İnsan-benzeri davranış: istekler arasına makul beklemeler koymak, gerçekçi tarayıcı başlıkları kullanmak, siteyi boğmayacak bir hızda ilerlemek.
  • Zarif başarısızlık: bir yöntem engellenirse alternatif bir motora/rotaya düşmek, ve her şeyden önce başarısızlığı sessizce yutmayıp fark etmek.

Toplamak yetmez: doğrulamak da gerekir

Bir crawler'ın "çalıştı" demesi, verinin doğru geldiği anlamına gelmez. Bir site tasarımını değiştirdiğinde, scraper hata vermeden boş ya da yanlış veri toplamaya başlayabilir — ve bu sessiz bozulma, en tehlikeli hata türüdür. Bu yüzden toplama katmanının üstünde bir sağlık kontrolü olmalıdır: bugünkü veri geldi mi, hacmi makul mü, beklenen alanlar dolu mu? Beklenmedik bir sapma varsa, rapor üretilmeden önce bir uyarı tetiklenir.

Sağlık kontrolü kapısı: toplanan veri hacim ve şema kontrolünden geçerse rapora akar, sapma varsa uyarı tetiklenip akış durur
Sağlık kontrolü kapısı: toplanan veri hacim ve şema kontrolünden geçerse rapora akar, sapma varsa uyarı tetiklenip akış durur

Doğruluğu koruyan ilkeler

  • Doğru siteye doğru motor. Tek beden herkese uymaz; motor seçimi hedefin doğasına göre yapılır.
  • Dağıt, yavaşla, saygılı ol. Sürdürülebilir toplama, siteyi boğmayan toplamadır; agresiflik kısa vadede hız, uzun vadede kalıcı engel getirir.
  • Sessiz bozulmayı yakala. "Hata yok" ile "veri doğru" aynı şey değildir; toplamanın çıktısı her zaman doğrulanır.

Sonuç

Güvenilir fiyat verisi, tek bir zeki scraper'dan değil, farklı motorların, proxy stratejisinin ve sağlık kontrollerinin orkestrasyonundan doğar. "Bir sayfadan fiyat çekmek" kolaydır; yüzlerce siteden, her gün, engellenmeden ve sessizce bozulmadan çekmek ise bir mühendislik disiplinidir.

Ölçekte dayanıklı, doğrulanmış rakip verisine ihtiyacınız varsa, Senkrondata ekibiyle konuşun.

E

Emre

Fiyat Zekâsı ve Veri Mühendisliği

Emre, rakip fiyat verisinin arkasındaki mekanizmayı yazıyor: ürün eşleştirme, normalizasyon, ölçekte veri toplama ve üzerine kurulan analitik katman.

Emre imzalı diğer yazılar

Bizimle İletişime Geçin

Detaylı bir demo veya genel bakış oturumu için e-posta adresinizi bırakın, sizinle hemen iletişime geçelim.