Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Hiyerarşik Kümeleme (Hierarchical Clustering)

Araç kavramları
Ing: Hierarchical ClusteringSon güncelleme: 5 Ekim 2026
Veriyi tek tek eşleştirip giderek büyüyen bir ağaç gibi gruplayan kümeleme yöntemi. Kaç küme istediğini önceden bilmene gerek yok.

Hiyerarşik kümeleme nedir?

Hiyerarşik kümeleme, verideki noktaları iç içe geçmiş gruplar halinde düzenleyen bir unsupervised learning yöntemi. k-means gibi "bana 3 küme ver" demek yerine, bütün olası gruplamaları bir ağaç yapısında çıkarır. Bu ağaca dendrogram denir: en altta her nokta kendi başına durur, en tepede hepsi tek bir kümede birleşir.

İki temel yaklaşım var. Birleştirici (agglomerative) yöntem aşağıdan yukarı çalışır: her nokta kendi kümesiyle başlar, en yakın iki küme adım adım birleştirilir. Bölücü (divisive) yöntem ise tersini yapar, hepsi tek kümedeyken yukarıdan aşağı böler. Pratikte neredeyse herkes birleştirici versiyonu kullanır.

Nasıl çalışır?

İş, iki kümenin birbirine "ne kadar yakın" sayılacağına karar vermekle başlar. Buna linkage (bağlama) kriteri denir:

  • Ward — kümelerin iç varyansını en az artıracak birleşmeyi seçer, dengeli boyutta kümeler üretir.
  • Complete — iki kümedeki en uzak iki nokta arasındaki mesafeye bakar, kompakt kümeler verir.
  • Average — bütün nokta çiftlerinin ortalama mesafesini alır, Euclidean dışı mesafelerde iyi iş çıkarır.
  • Single — en yakın iki noktaya bakar; hızlıdır ama kümeleri zincir gibi uzatma eğilimindedir.

Algoritma her adımda bu kritere göre en yakın iki kümeyi birleştirir ve bunu tek küme kalana kadar tekrarlar. Sonuçta çıkan dendrogramı istediğin yükseklikten "keserek" kaç küme istediğini sonradan belirleyebilirsin.

Neden önemli?

En büyük avantajı, küme sayısını baştan dayatmaması. Dendrograma bakıp verinin doğal olarak kaça ayrıldığını görebilirsin. Ayrıca gruplar arası hiyerarşiyi gösterir: hangi alt grubun hangi büyük gruba bağlı olduğunu tek bakışta anlarsın. k-means yalnızca yuvarlak (convex) kümelerde iyiyken, doğru linkage ile hiyerarşik kümeleme daha karmaşık şekillerle de baş edebilir.

Dezavantajı maliyet: tipik uygulaması O(n²) bellek ve zaman ister, yani çok büyük veri setlerinde zorlanır.

Kullanım alanları

Biyoloji ve genetikte türler ya da genler arası akrabalık ağaçları çıkarmak bunun klasik örneği. Pazarlamada müşteri segmentasyonu, metin madenciliğinde belgeleri konuya göre gruplama, görüntü işlemede bölütleme (segmentation) sık kullanılan alanlar. Keşif aşamasında "bu veri kaç gruba ayrılıyor acaba" sorusuna cevap aramak için de ideal.

mindi
mindi'nin notu
Güçlü yön — Küme sayısını baştan bilmene gerek yok, dendrogram sana gösterir. Dikkat — O(n²) maliyeti yüzünden yüz binlerce satırda tıkanır; önce örneklem al.