Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Bağımsız ve Özdeş Dağılım (i.i.d.)

Araç kavramları
Ing: Independent and Identically DistributedSon güncelleme: 25 Eylül 2026
Veri örneklerinin birbirinden bağımsız olduğu ve hepsinin aynı dağılımdan geldiği varsayımı. Makine öğrenmesinin sessiz temel taşı.

Bağımsız ve Özdeş Dağılım nedir?

Bağımsız ve özdeş dağılım (independent and identically distributed, kısaca i.i.d.), bir veri kümesindeki örneklerin iki özelliği aynı anda taşıdığı varsayımıdır:

  • Bağımsız: Bir örneğin değeri, diğer örnekler hakkında bilgi vermez. Bir zarın bir atışı, bir sonraki atışı etkilemez.
  • Özdeş dağılımlı: Tüm örnekler aynı olasılık dağılımından gelir. Her atışta aynı zar kullanılır.

Makine öğrenmesi algoritmalarının ve istatistiksel yöntemlerin büyük kısmı bu varsayıma dayanır; çoğu zaman açıkça söylenmeden.

Nasıl çalışır?

Bir model eğitildiğinde, eğitim verisinden öğrendiklerinin test verisine ve gerçek dünyaya genellenebileceğini varsayarız. Bu varsayımın matematiksel dayanağı i.i.d.'dir. Eğitim ve test verisi aynı dağılımdan bağımsız olarak çekildiyse, eğitimdeki başarı gelecekteki başarının güvenilir bir tahminidir.

Varsayım farklı şekillerde bozulabilir:

  • Bağımsızlık ihlali: Zaman serilerinde bugünün değeri dünküne bağlıdır. Aynı hastadan alınan birden fazla ölçüm birbirine benzer. Bu durumda rastgele train-test split yapmak, modelin aslında ezberlediği bilgiyi test setinde görmesine yol açar.
  • Özdeş dağılım ihlali: Model eğitildikten sonra dünya değişebilir. Pandemi öncesi verisiyle eğitilmiş bir talep modeli, pandemi döneminde farklı bir dağılımla karşılaşır. Buna distribution shift, zamanla yavaş gerçekleşenine concept drift denir.
  • Toplama yanlılığı: Veri farklı kaynaklardan, farklı koşullarda toplandıysa tek bir dağılımdan gelmez.

Neden önemli?

i.i.d. varsayımı bozulduğunda model sessizce başarısız olur. Test metrikleri iyi görünür ama gerçek hayatta performans düşer. Out-of-distribution veriler, veri sızıntısı, eğitim-sunum sapması ve concept drift gibi sorunların hepsi aslında bu varsayımın farklı şekillerde çiğnenmesidir.

Gerçek dünya verisi neredeyse hiçbir zaman tam olarak i.i.d. değildir. Önemli olan, varsayımın ne kadar ve nasıl bozulduğunu bilmek ve buna göre önlem almaktır.

Kullanım alanları

  • Veri bölme stratejisi: Zaman serilerinde tarihe göre, gruplu verilerde kişi veya kaynak bazında bölmek.
  • Cross-validation: Grup ve zaman yapısına uygun doğrulama yöntemleri seçmek.
  • Model izleme: Canlı verinin eğitim dağılımından ne kadar saptığını takip etmek.
  • Federated learning: Farklı cihazlardaki verinin i.i.d. olmadığı durumlar için özel algoritmalar tasarlamak.
  • Mini-batch eğitimi: Veriyi karıştırarak her batch'in genel dağılımı temsil etmesini sağlamak.
mindi
mindi'nin notu
i.i.d., makine öğrenmesinin küçük puntolu sözleşme maddesi gibi. Kimse okumaz, ama model sahada çuvalladığında ilk bakılacak yer orası. "Test verim gerçekten bağımsız mı?" sorusunu sormayı alışkanlık haline getir.