Veri Ön İşleme (Data Preprocessing)
Veri & eğitimData Preprocessing nedir?
Veri ön işleme, ham veriyi bir modelin anlayabileceği ve öğrenebileceği hale getirme aşaması. "Garbage in, garbage out" — çöp girerse çöp çıkar. Gerçek dünya verisi dağınıktır: eksik hücreler, tutarsız formatlar, aykırı değerler, farklı ölçekler. Model eğitiminin en çok zaman alan ama sonucu en çok etkileyen kısmı çoğu zaman burasıdır.
Nasıl çalışır?
Tipik adımlar: eksik verileri doldurma ya da atma (imputation), metin ve kategori verilerini sayıya çevirme (one-hot encoding, label encoding), sayısal değişkenleri ortak ölçeğe getirme (normalization, standardization), aykırı değerleri (outlier) ele alma ve gerektiğinde veriyi dönüştürme (log dönüşümü gibi). Metinde ek olarak tokenization, küçük harfe çevirme ve stop words temizliği gelir. Kritik kural: ölçekleme ve doldurma parametreleri sadece eğitim verisinden öğrenilir, sonra test verisine uygulanır — aksi halde data leakage oluşur.
Neden önemli?
İyi tasarlanmış bir model bile kötü hazırlanmış veriyle çuvallar. Ölçekleri farklı değişkenler gradient descent'i yavaşlatır; eksik veriler modeli yanıltır; sızan bilgi ise gerçekte olmayan bir başarı yanılsaması yaratır. Ön işleme, modelin adil ve tekrarlanabilir öğrenmesinin temelidir.
Kullanım alanları
Her makine öğrenmesi projesinin ilk aşaması. Tablo verisi, görüntü (yeniden boyutlandırma, piksel normalizasyonu), ses ve metin — hepsinin kendine özgü ön işleme boru hattı (pipeline) vardır. Üretimde bu adımlar genelde bir pipeline nesnesine sarılır ki eğitimde uygulanan dönüşüm, canlıda gelen yeni veriye birebir uygulanabilsin.
Ilgili terimler
