Söz Varlığı (Vocabulary)
Araç kavramlarıVocabulary nedir?
Bir dil modelinin tanıdığı bütün token'ların sabit listesine vocabulary denir. Model metni tek tek harfler olarak değil, bu listedeki parçalar üzerinden okur ve üretir. Türkçe'de "söz varlığı" desek de pratikte bu liste kelimelerden değil, kelime parçalarından (subword) oluşur. Yani "koşuyorum" tek bir girdi olmayabilir; "koş", "uyor", "um" gibi parçalara bölünür.
Nasıl çalışır?
Eğitim başlamadan önce bir tokenizer, devasa bir metin yığınına bakıp en sık geçen karakter dizilerini birleştirerek bu listeyi kurar. Byte Pair Encoding gibi yöntemler sık tekrar eden parçaları tek bir girdiye dönüştürür. Listedeki her parçaya bir sayı (ID) atanır; modelin gerçekte gördüğü şey bu ID dizisidir. Bir vocabulary tipik olarak 30 bin ile 250 bin arası girdi içerir. Liste büyüdükçe aynı cümle daha az token'a sığar, ama modelin embedding tablosu da o oranda şişer — yani bir denge kurmak gerekir.
Neden önemli?
Vocabulary, bir modelin ne kadar verimli çalıştığını doğrudan belirler. Türkçe gibi ekli bir dilde, İngilizce ağırlıklı kurulmuş bir vocabulary tek kelimeyi 4-5 token'a bölerek hem işlem maliyetini hem gecikmeyi (latency) artırır. Listede karşılığı olmayan bir dizi ise "bilinmeyen" parçalara düşer ve çıktı kalitesi bozulur. Aynı metnin farklı modellerde farklı sayıda token tutmasının sebebi budur.
Kullanım alanları
Her LLM, çeviri sistemi ve konuşma tanıma modeli kendi vocabulary'siyle gelir. Fine-tuning sırasında genelde aynı liste korunur; yeni bir alan jargonu (örneğin tıbbi terimler) eklemek için vocabulary genişletme yapılır. Bir modelin Türkçe performansını değerlendirirken, tokenizer'ının uzun bir Türkçe paragrafı kaç token'a böldüğüne bakmak hızlı ve güvenilir bir ipucudur.
