t-SNE (t-Distributed Stochastic Neighbor Embedding)
Araç kavramlarıt-SNE nedir?
t-SNE, çok yüksek boyutlu veriyi (mesela 768 boyutlu bir embedding vektörünü) 2 ya da 3 boyuta indirerek bir grafikte çizilebilir hale getiren bir boyut indirgeme tekniğidir. 2008''de Laurens van der Maaten ve Geoffrey Hinton tarafından ortaya atıldı. Amaç sayı yığınını insanın gözüyle anlayabileceği bir haritaya çevirmek: birbirine benzeyen veriler haritada yan yana, farklı olanlar uzakta durur.
Nasıl çalışır?
t-SNE önce yüksek boyutlu uzayda her nokta çiftinin birbirine "ne kadar komşu" olduğunu bir olasılık dağılımıyla ölçer. Sonra düşük boyutlu (2D/3D) uzayda aynı komşuluk ilişkilerini olabildiğince koruyacak bir yerleşim arar. İki dağılım arasındaki farkı KL-diverjansı •iki olasılık dağılımının ne kadar ayrıştığını ölçen değer• üzerinden azaltır. Düşük boyutta uzak noktalar için ağır kuyruklu bir dağılım (Student t) kullanması, kümelerin birbirine yapışmadan ayrı ayrı durmasını sağlar. Bu yüzden adında "t" var.
Neden önemli?
Modern AI''da her şey vektöre dönüşüyor: kelimeler, cümleler, görseller, kullanıcılar. Bu vektörlerin gerçekten anlamlı gruplar oluşturup oluşturmadığını çıplak gözle göremezsin, çünkü onlarca hatta yüzlerce boyutları var. t-SNE bu görünmezliği kırar; bir embedding modelinin "kedi" ile "köpek"i yakın, "kedi" ile "traktör"ü uzak tutup tutmadığını tek bakışta görürsün.
Kullanım alanları
Embedding kalitesini denetlemek, bir dil modelinin öğrendiği temsilleri incelemek, kümeleme sonuçlarını doğrulamak ve veri setindeki gizli grupları keşfetmek için kullanılır. Not: t-SNE haritasındaki kümeler arası uzaklıklar ve küme boyutları güvenilir değildir, sadece hangi noktaların bir arada durduğu anlamlıdır. Benzer bir alternatif olan UMAP, büyük veride daha hızlı çalıştığı için son yıllarda sık tercih ediliyor.
Ilgili terimler
