K-Means Kümeleme (K-Means Clustering)
Araç kavramlarıK-Means nedir?
K-means, elindeki etiketsiz veriyi önceden belirlediğin k adet kümeye (gruba) ayıran unsupervised learning algoritmasıdır. "Bu müşteriler birbirine benziyor" ya da "bu belgeler aynı konudan" gibi grupları, sen söylemeden verinin kendi yapısından çıkarır. Adındaki "means" (ortalamalar) her kümenin merkezini o kümedeki noktaların ortalamasıyla temsil etmesinden gelir.
Nasıl çalışır?
Algoritma basit bir döngüyle ilerler: (1) Rastgele ya da akıllı bir yöntemle (k-means++) k adet merkez seçilir. (2) Her veri noktası kendisine en yakın merkeze atanır — küme burada oluşur. (3) Her kümenin merkezi, o kümeye düşen noktaların ortalaması alınarak yeniden hesaplanır. (4) Merkezler artık kaymayana kadar 2. ve 3. adım tekrarlanır. Bu "ata-güncelle" döngüsü küme içi toplam uzaklığı (inertia) minimize etmeye çalışır. k sayısını sen verirsin; doğru k'yi bulmak için elbow yöntemi ya da silhouette skoru kullanılır.
Neden önemli?
K-means, makine öğrenmesinin en eski ama hâlâ en çok kullanılan araçlarından biri. Hızlı, anlaşılır ve büyük veride bile çalışır. Etiketli veriye ihtiyaç duymaması onu keşif aşaması için ideal yapar — elinde ne olduğunu bilmediğin bir veri yığını varsa, k-means sana ilk haritayı çıkarır. Zayıf tarafı: küresel ve eşit boyutlu kümeler varsayar, başlangıç merkezlerine duyarlıdır ve aykırı değerlerden kolay etkilenir.
Kullanım alanları
Müşteri segmentasyonu (benzer alışveriş davranışına göre gruplama), görüntü renk azaltma (renk paletini kümeleme), belge ve konu gruplama, anomali tespitinde ön adım, embedding vektörlerini kümeleyerek büyük dil modeli çıktılarını organize etme. RAG hattında benzer içerikleri kümelemek için de sık başvurulur.
Ilgili terimler
