DBSCAN (Yoğunluk Tabanlı Kümeleme)
Veri & eğitimDBSCAN nedir?
DBSCAN (Density-Based Spatial Clustering of Applications with Noise), veriyi yoğunluğa göre gruplayan bir unsupervised •etiketsiz veriyle çalışan• öğrenme algoritmasıdır. Bakış açısı basit: kümeler yoğun nokta bölgeleridir, bu bölgeleri seyrek boşluklar birbirinden ayırır.
En belirgin farkı, k-means''ten ayrıldığı yer: kaç küme olacağını önceden söylemen gerekmez. Algoritma bunu verinin kendisinden çıkarır. Üstüne, hiçbir kümeye uymayan noktaları gürültü (outlier) olarak işaretler — onları zorla bir kümeye tıkıştırmaz.
Nasıl çalışır?
İki parametreye dayanır: eps (ε) •bir noktanın komşuluk yarıçapı• ve min_samples •bir noktanın çekirdek sayılması için gereken minimum komşu sayısı•.
Noktalar üçe ayrılır:
- Çekirdek nokta: eps yarıçapı içinde en az min_samples kadar komşusu olan nokta. Kümelerin belkemiğidir.
- Sınır noktası: kendi başına yeterli komşusu yok ama bir çekirdek noktaya yakın.
- Gürültü: ne çekirdek ne sınır — hiçbir kümeye ait değil.
Algoritma önce çekirdek noktaları bulur, birbirine eps mesafesinde olanları aynı kümede birleştirir, sınır noktalarını en yakın kümeye ekler. Gürültü noktaları dışarıda kalır.
Neden önemli?
k-means yuvarlak, dışbükey kümeler varsayar; gerçek dünya verisi çoğu zaman öyle değil. DBSCAN her türlü şekilde küme bulabilir — hilal, halka, düzensiz lekeler. Aykırı değerlere de dayanıklıdır çünkü onları en baştan ayrı tutar.
eps seçimi kritik: çok küçük seçersen çoğu nokta gürültü sayılır; çok büyük seçersen yakın kümeler birleşir ve sonunda tüm veri tek kümeye çöker. En yakın komşu mesafelerinin grafiğindeki "dirsek" noktası pratik bir ipucu verir.
Kullanım alanları
Coğrafi veri kümeleme, anomali ve aykırı değer tespiti, düzensiz şekilli grupların çıkarılması. Çok büyük veri setlerinde bellek sıkışırsa HDBSCAN veya OPTICS gibi türevleri tercih edilir.
Ilgili terimler
