Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Kutulama (Binning)

Veri & eğitim
Ing: Binning / BucketingSon güncelleme: 25 Eylül 2026
Sürekli bir değeri aralıklara bölüp kategorilere çevirmek. Yaşı "18-24, 25-34, 35-44" gibi gruplara ayırmak tam olarak budur.

Kutulama nedir?

Kutulama (binning veya bucketing), sürekli sayısal bir özelliği belirli aralıklara bölerek kategorik bir özelliğe dönüştürme işlemidir. Her aralığa "kutu" (bin) denir. Yaş, gelir, sıcaklık ya da mesafe gibi değerler bu yöntemle gruplanabilir.

Örneğin sıcaklık verisini "0°C altı", "0-15°C", "15-25°C" ve "25°C üstü" diye dört kutuya ayırabilirsin. Artık model tek bir sayıyla değil, dört kategoriyle çalışır.

Nasıl çalışır?

En yaygın iki yöntem şunlardır:

  • Eşit genişlikli kutulama: Değer aralığı eşit parçalara bölünür. 0-100 arası bir değer için 0-10, 10-20 gibi. Basittir ama veri dengesizse bazı kutular dolup taşarken bazıları boş kalır.
  • Kantil tabanlı kutulama: Her kutuya yaklaşık aynı sayıda örnek düşecek şekilde sınırlar belirlenir. Çarpık dağılımlarda (gelir verisi gibi) daha sağlıklı sonuç verir.

Kutu sınırları alan bilgisiyle de belirlenebilir. Tıbbi bir modelde tansiyon değerlerini klinik eşiklere göre kutulamak, rastgele aralıklardan çok daha anlamlıdır.

Kutulamadan sonra her kutu genellikle one-hot encoding ile temsil edilir. Böylece model her aralık için ayrı bir ağırlık öğrenebilir.

Neden önemli?

Bazı özelliklerin etkisi doğrusal değildir. Enlem ile konut fiyatı arasındaki ilişki düz bir çizgi değildir; belirli bölgelerde fiyat sıçrar. Doğrusal bir model ham enlemi kullanırsa bu sıçramaları yakalayamaz. Kutulama, her bölgeye ayrı bir ağırlık vererek bu doğrusal olmayan etkiyi öğrenmeyi mümkün kılar.

Ayrıca kutulama aykırı değerlerin etkisini yumuşatır ve modeli küçük ölçüm gürültülerine karşı daha dayanıklı hale getirir. Bedeli ise bilgi kaybıdır: 25 ile 34 yaş aynı kutuya düşünce aradaki fark kaybolur. Kutu sayısını doğru seçmek bu yüzden önemlidir.

Kullanım alanları

  • Demografik veri: Yaş ve gelir gruplarıyla segmentasyon.
  • Konum verisi: Enlem/boylamı kutulayıp bölgesel özellik üretmek.
  • Feature cross öncesi hazırlık: Sürekli değerleri çaprazlanabilir hale getirmek.
  • Karar ağaçları ve gradient boosting: Bazı kütüphaneler hız için değerleri içeride otomatik kutular.
  • Raporlama: Model çıktılarını insanların okuyabileceği gruplara ayırmak.
  • Gizlilik: Tam yaş ya da tam gelir yerine aralık paylaşmak, kişisel verinin tanımlanabilirliğini azaltır. Bu yüzden kutulama, anonimleştirme süreçlerinde de sıkça kullanılan basit ama etkili bir adımdır ve veri paylaşımını daha güvenli hale getirir.
mindi
mindi'nin notu
Kutulama, veriyi biraz bulanıklaştırıp daha anlaşılır yapmak. Az kutu bilgi kaybettirir, çok kutu gürültü getirir. Sihirli sayı yok; veriye bakıp karar vermek gerekiyor.