Gauss Karışım Modeli (GMM)
Araç kavramlarıGauss Karışım Modeli nedir?
K-means''i biliyorsan, her veri noktasını tek bir kümeye sokar — "sen bu gruptansın, bitti". Ama gerçek hayat o kadar keskin değil. Bir müşteri hem "fırsatçı" hem "sadık" olabilir, sadece farklı oranlarda. Gauss Karışım Modeli (GMM) işte bu gri alanı modelliyor.
GMM, tüm veri noktalarının birden fazla Gauss (normal) dağılımının karışımından üretildiğini varsayan olasılıksal bir model. Yani veriyi, üst üste binmiş birkaç çan eğrisinin toplamı olarak görüyor. Her nokta bir kümeye kesin atanmıyor; "bu noktanın %70 şu kümeden, %30 bu kümeden gelme olasılığı var" diyor. Buna soft clustering •yumuşak kümeleme• deniyor.
Nasıl çalışır?
Problem şu: veriler etiketsiz, hangi noktanın hangi dağılımdan geldiğini bilmiyoruz. Çözüm Expectation-Maximization (EM) algoritması. İki adımda döner:
- E-adımı (Expectation): Her nokta için, her bir bileşenden gelme olasılığını hesapla.
- M-adımı (Maximization): Bu olasılıklara göre dağılımların parametrelerini (ortalama, kovaryans, ağırlık) güncelle.
Bu iki adım, model yakınsayana kadar tekrarlanıyor ve EM''in yerel bir optimuma ulaşması garanti. K-means''ten farkı: GMM sadece küme merkezini değil, kümenin şeklini ve yayılımını da (covariance •kovaryans•) öğreniyor. Böylece elips biçimli, farklı yoğunluktaki kümeleri de yakalayabiliyor — k-means hep yuvarlak kümeler varsayar.
Neden önemli?
Doğru küme sayısını seçmek için BIC (Bayesian Information Criterion) gibi ölçütler kullanılabiliyor. Olasılıksal çıktı verdiği için belirsizliği de ölçebiliyorsun: bir nokta hiçbir kümeye net oturmuyorsa, bu bir anomali sinyali olabilir. Yani GMM sadece kümeleme değil, yoğunluk tahmini ve aykırı değer tespiti için de kullanılıyor.
Kullanım alanları
Müşteri segmentasyonu, konuşma tanımada ses modelleme, görüntü segmentasyonu, anomali tespiti ve genel yoğunluk tahmini. scikit-learn''ün GaussianMixture sınıfıyla birkaç satırda kurulabiliyor; predict_proba ile sert değil, olasılıksal atama alabiliyorsun.
Ilgili terimler
