Hiyerarşik Kümeleme (Hierarchical Clustering)
Araç kavramlarıHiyerarşik kümeleme nedir?
Hiyerarşik kümeleme, verideki noktaları iç içe geçmiş gruplar halinde düzenleyen bir unsupervised learning yöntemi. k-means gibi "bana 3 küme ver" demek yerine, bütün olası gruplamaları bir ağaç yapısında çıkarır. Bu ağaca dendrogram denir: en altta her nokta kendi başına durur, en tepede hepsi tek bir kümede birleşir.
İki temel yaklaşım var. Birleştirici (agglomerative) yöntem aşağıdan yukarı çalışır: her nokta kendi kümesiyle başlar, en yakın iki küme adım adım birleştirilir. Bölücü (divisive) yöntem ise tersini yapar, hepsi tek kümedeyken yukarıdan aşağı böler. Pratikte neredeyse herkes birleştirici versiyonu kullanır.
Nasıl çalışır?
İş, iki kümenin birbirine "ne kadar yakın" sayılacağına karar vermekle başlar. Buna linkage (bağlama) kriteri denir:
- Ward — kümelerin iç varyansını en az artıracak birleşmeyi seçer, dengeli boyutta kümeler üretir.
- Complete — iki kümedeki en uzak iki nokta arasındaki mesafeye bakar, kompakt kümeler verir.
- Average — bütün nokta çiftlerinin ortalama mesafesini alır, Euclidean dışı mesafelerde iyi iş çıkarır.
- Single — en yakın iki noktaya bakar; hızlıdır ama kümeleri zincir gibi uzatma eğilimindedir.
Algoritma her adımda bu kritere göre en yakın iki kümeyi birleştirir ve bunu tek küme kalana kadar tekrarlar. Sonuçta çıkan dendrogramı istediğin yükseklikten "keserek" kaç küme istediğini sonradan belirleyebilirsin.
Neden önemli?
En büyük avantajı, küme sayısını baştan dayatmaması. Dendrograma bakıp verinin doğal olarak kaça ayrıldığını görebilirsin. Ayrıca gruplar arası hiyerarşiyi gösterir: hangi alt grubun hangi büyük gruba bağlı olduğunu tek bakışta anlarsın. k-means yalnızca yuvarlak (convex) kümelerde iyiyken, doğru linkage ile hiyerarşik kümeleme daha karmaşık şekillerle de baş edebilir.
Dezavantajı maliyet: tipik uygulaması O(n²) bellek ve zaman ister, yani çok büyük veri setlerinde zorlanır.
Kullanım alanları
Biyoloji ve genetikte türler ya da genler arası akrabalık ağaçları çıkarmak bunun klasik örneği. Pazarlamada müşteri segmentasyonu, metin madenciliğinde belgeleri konuya göre gruplama, görüntü işlemede bölütleme (segmentation) sık kullanılan alanlar. Keşif aşamasında "bu veri kaç gruba ayrılıyor acaba" sorusuna cevap aramak için de ideal.
Ilgili terimler
