Durak Kelimeler (Stop Words)
Araç kavramlarıStop words nedir?
Stop words (durak kelimeler), bir dilde çok sık geçen ama tek başına ayırt edici anlamı olmayan kelimelerdir: Türkçede "ve", "bir", "bu", "ile", "de"; İngilizcede "the", "a", "of", "to". Klasik metin işleme sistemleri, indeksi küçültmek ve gürültüyü azaltmak için bu kelimeleri bir "durdurma listesine" (stop list) koyup metinden çıkarabilir.
Mantık şu: "kediler ve köpekler" ifadesinde asıl bilgi "kedi" ve "köpek"te. "ve" kelimesi neredeyse her belgede geçtiği için aramada işe yaramaz, sadece yer kaplar. Onu elemek indeksi ciddi biçimde küçültür.
Nasıl çalışır?
Önce metin token'lara ayrılır, sonra her token önceden hazırlanmış durdurma listesiyle karşılaştırılır. Listede olan kelimeler atılır, kalanlar indekslenir veya modele verilir. Liste dile özeldir ve genellikle kelime frekansına bakılarak, yani en sık geçen birkaç yüz kelime seçilerek oluşturulur.
Ama dikkat: durak kelimeleri elemek her zaman doğru değildir. "As we may think" gibi bir başlık ya da "flights to London" gibi bir ifade, durak kelimeler atılınca anlamını kaybeder. Bu yüzden modern arama sistemlerinin çoğu artık stop word'leri tamamen atmak yerine tutmayı tercih ediyor — indeks maliyeti eskisi kadar sorun değil.
Neden önemli?
Stop word eleme, klasik bilgi getirimi ve TF-IDF tabanlı sistemlerde indeks boyutunu ve işlem süresini azaltan basit ama etkili bir tekniktir. Aynı zamanda hangi kelimelerin "anlam taşıdığı" sorusuna pratik bir yaklaşımdır.
Kullanım alanları
Arama motorları, doküman sınıflandırma, konu modelleme (topic modeling) ve anahtar kelime çıkarımı gibi klasik NLP görevlerinde ön işleme adımı olarak kullanılır. Büyük dil modelleri ise bağlamı tümüyle kullandığı için stop word'leri elemez; onlar için "ve", "bir" gibi kelimeler de cümlenin yapısını taşır.
Ilgili terimler
