Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Örnekleme Yanlılığı (Sampling Bias)

Genel
Ing: Sampling BiasSon güncelleme: 25 Eylül 2026
Veri toplanırken örneklerin rastgele seçilmemesinden doğan yanlılık. Anketi sadece sabah 9'da telefonu açanlara yapmak gibi.

Örnekleme Yanlılığı nedir?

Örnekleme yanlılığı (sampling bias), bir veri kümesi oluşturulurken örneklerin hedef popülasyondan rastgele seçilmemesi sonucu ortaya çıkan yanlılıktır. Bazı grupların seçilme olasılığı diğerlerinden sistematik olarak daha yüksek ya da düşük olduğunda, elde edilen veri popülasyonu doğru temsil etmez.

Örnekleme yanlılığı, daha geniş bir kavram olan seçim yanlılığının (selection bias) bir alt türüdür. Seçim yanlılığı veri kümesine girenlerin genel olarak çarpık olmasını anlatırken, örnekleme yanlılığı özellikle örnekleme yönteminin kendisindeki rastgelelik eksikliğine odaklanır.

Nasıl çalışır?

Klasik bir örnek: Bir ürün hakkında görüş toplamak için sadece sabah 9 ile 10 arasında sabit telefonla arama yaptığını düşün. Bu saatte evde olan ve sabit telefonu olan kişiler, genel nüfustan farklı bir profile sahiptir: Muhtemelen daha yaşlılar, çalışmıyorlar ya da evden çalışıyorlar. Sonuçlar ne kadar çok kişiye ulaşılırsa ulaşılsın, bu grubu yansıtır.

Makine öğrenmesinde örnekleme yanlılığının tipik kaynakları şunlardır:

  • Kolaylık örneklemesi: Erişimi en kolay veriyi kullanmak. Sadece bir hastanenin kayıtlarıyla eğitilen bir tanı modeli, farklı demografiye sahip başka bir hastanede zorlanabilir.
  • Zamansal örnekleme: Verinin sadece belirli bir dönemden toplanması. Sadece yaz aylarının satış verisiyle eğitilen bir model kışı bilmez.
  • Platform yanlılığı: Sadece belirli bir sosyal medya platformundan toplanan metinler, o platformun kullanıcı profilini yansıtır.
  • Coğrafi yoğunlaşma: Görüntü veri kümelerinin büyük kısmının belirli ülkelerden gelmesi, modellerin diğer bölgelerdeki nesneleri ve sahneleri daha kötü tanımasına yol açabilir.

Neden önemli?

Örnekleme yanlılığının tehlikesi, veri miktarını artırarak çözülememesidir. Yanlı bir yöntemle bir milyon örnek toplamak, yanlı bir yöntemle bin örnek toplamaktan daha temsili değildir; sadece yanlılığa daha fazla güven duyulmasına neden olur. Model test setinde iyi performans gösterir, çünkü test seti de aynı yanlı yöntemle toplanmıştır. Sorun ancak model gerçek dünyada farklı bir kitleyle karşılaştığında ortaya çıkar.

Kullanım alanları

Örnekleme yanlılığını azaltmak için kullanılan yöntemler:

  • Rastgele örnekleme: Popülasyondaki her bireyin eşit seçilme şansına sahip olmasını sağlamak.
  • Tabakalı örnekleme: Popülasyonu önemli alt gruplara ayırıp her birinden orantılı örnek almak.
  • Veri kaynağı çeşitlendirme: Farklı bölge, platform ve dönemlerden veri toplamak.
  • Ağırlıklandırma: Az temsil edilen gruplara analizde daha fazla ağırlık vermek.
  • Belgeleme: Verinin nasıl, nereden ve kimden toplandığını açıkça kaydetmek.
mindi
mindi'nin notu
"Elimizde milyonlarca veri var" cümlesi örnekleme yanlılığına karşı bir güvence değil. Asıl soru "bu milyonlarca veri kimi temsil ediyor, kimi dışarıda bırakıyor?"