Web Crawler
Web crawler nedir?
Web crawler (örümcek ya da bot olarak da anılır), bağlantıları sayfadan sayfaya izleyerek web sitelerini sistematik biçimde gezen ve içerik keşfeden bir programdır. En bilinen crawler’ları Google gibi arama motorları çalıştırır; ancak crawler’lar e-ticaret veri toplamayı, site denetimini ve arşivlemeyi de mümkün kılar.
Crawling ve scraping ilişkili ama ayrı adımlardır: crawler hangi URL’lerin var olduğunu keşfeder (örneğin bir kategori ağacındaki tüm ürün sayfaları), scraper ise o sayfalardan yapılandırılmış veriyi çıkarır. Bir e-ticaret hattında crawler her gece perakendecinin tüm kataloğunu haritalayabilir, scraper da keşfedilen her ürün için fiyat ve stok toplar.
İyi davranan crawler’lar kendilerini bir user-agent dizesiyle tanıtır, robots.txt yönergelerine uyar ve istek hızlarını kısarak hedef sitenin performansını asla düşürmez.
İlgili Terimler
- Veri TaramaBir sitedeki ya da web genelindeki URL'lerin, veri çıkarımından önce otomatik olarak keşfedilmesi.
- Web ScrapingWeb sitelerindeki herkese açık verinin ölçekli ve otomatik olarak toplanması.
- Veri AyrıştırmaHam HTML veya JSON verisini yapılandırılmış bir formata dönüştürme süreci.
- Rate Limiting (İstek Limitleme)Bir istemcinin belirli bir zaman aralığında sunucuya yapabileceği istek sayısının sınırlanması.