Kategori: Kazıma
Ham HTML'den AI-Hazır Veri Setine: Normalizasyonun Görünmeyen İşi
AI-hazır veri seti nasıl oluşturulur? Senkrondata dağınık ürün sayfalarını tutarlı, yapılandırılmış tek bir veri setine nasıl normalize eder?
Bir ürün, A sitesinde "500 ML Şampuan", B sitesinde "0.5 L Shampoo", C sitesinde "500ml — Şampuan (Aile Boy)" olarak yazılabilir. Fiyatı biri "149,90 TL", diğeri "₺149.90" olarak gösterebilir. Bir tarayıcı bunları insan gözüyle aynı şekilde okur; ama bir veritabanı, bir BI aracı ya da bir dil modeli için bu üç metin üç farklı şeydir — normalize edilene kadar.
AI-hazır bir veri seti, ham HTML'in doğrudan bir çıktısı değildir. Aradaki fark, görünmeyen ama kritik bir katmandır: normalizasyon.
Ham veri neden "hazır" değildir
Her site kendi tasarım ve yazım kurallarına sahiptir: farklı birim gösterimleri (ml/L, gr/kg), farklı para birimi formatları, farklı ondalık ayırıcılar, farklı kategori isimlendirmeleri, HTML içine gömülü gereksiz boşluklar/karakterler. Bunun üstüne, aynı bilgi bazen yapılandırılmış bir alanda (bir "marka" kutusu), bazen serbest metnin içinde gömülü gelir.
Bu ham hali doğrudan bir analiz aracına ya da bir dil modeline verirseniz, model zamanının çoğunu "bu iki metin aynı şeyi mi söylüyor?" sorusuyla boğuşarak geçirir — asıl işi yapamadan.
Normalizasyon: tutarlılık üretmek
Normalizasyon katmanı, her kaynaktan gelen farklı temsili ortak bir şemaya indirger:
- Birim ve para birimi standardizasyonu: "0.5 L" ve "500 ML" aynı sayısal değere, aynı birime çevrilir.
- Alan ayrıştırma: serbest metne gömülü marka/renk/beden gibi bilgiler, ayrı alanlara çıkarılır (mümkün olduğunca — bazı kategorilerde bu kısmi kalır).
- Kategori haritalama: her sitenin kendi kategori ağacı, ortak bir taksonomiye eşlenir.
- Temizlik: gereksiz boşluk, HTML kalıntısı, kodlama hataları giderilir.
Sonuç, hangi kaynaktan geldiğine bakılmaksızın aynı şekle sahip bir kayıt kümesidir — bu da onu bir sonraki adıma, yani makine tarafından tüketilmeye hazır hale getirir.
"AI-hazır" ne anlama gelir
Bir veri setinin AI/BI araçları için "hazır" olması üç şeyi gerektirir:
- Tutarlı şema: her kayıt aynı alanlara, aynı tiplerde sahiptir — bir dil modeli ya da bir sorgu motoru, alan alan ne bekleyeceğini bilir.
- Bağlam kaybı olmaması: normalizasyon sadeleştirirken orijinal bilgiyi silmez; "500 ML" hem standart birime çevrilir hem de kaynaktaki orijinal ifade korunur.
- İzlenebilirlik: her normalize edilmiş alanın hangi kaynaktan, ne zaman geldiği bellidir — bu da hem denetim hem hata ayıklama için gereklidir.
Bu üçü sağlandığında, veri seti yalnızca insan gözüyle okunabilir bir tablo değil, doğrudan bir modelin ya da bir raporlama motorunun güvenle üzerine inşa edebileceği bir temel olur.
Doğruluğu koruyan ilkeler
- Normalizasyon bilgi kaybetmez, biçim standartlaştırır. Orijinal metin her zaman erişilebilir kalır; sadece üstüne tutarlı bir katman eklenir.
- Eksik veri "boş" olarak işaretlenir, tahmin edilmez. Bir alan çıkarılamadıysa, sessizce bir varsayılan değerle doldurmak yerine eksik olarak bırakılır — aksi halde yanlış bir kesinlik hissi yaratılır.
- Şema, kaynaklardaki değişikliğe göre evrilir ama geriye dönük kırmaz. Yeni bir alan eklenebilir; mevcut tüketicilerin (rapor, model) beklediği alanlar aniden kaybolmaz.
Sonuç
Ham HTML ile AI-hazır veri seti arasındaki fark, çoğunlukla görünmeyen bir normalizasyon katmanıdır — birimleri, para birimlerini, kategorileri, öznitelikleri ortak bir dile çeviren, bilgiyi kaybetmeden tutarlılık üreten bir iş. Bu katman ne kadar sağlamsa, üstüne kurulan her analiz, her rapor, her model o kadar güvenilir olur.
Ham veriyi güvenilir, AI-hazır bir veri setine dönüştürmek istiyorsanız, Senkrondata ekibiyle konuşun.
Emre
Fiyat Zekâsı ve Veri Mühendisliği
Emre, rakip fiyat verisinin arkasındaki mekanizmayı yazıyor: ürün eşleştirme, normalizasyon, ölçekte veri toplama ve üzerine kurulan analitik katman.
Emre imzalı diğer yazılarBizimle İletişime Geçin
Detaylı bir demo veya genel bakış oturumu için e-posta adresinizi bırakın, sizinle hemen iletişime geçelim.
