Nedensel Dil Modelleme (Causal Language Modeling)
MimariNedensel Dil Modelleme nedir?
Nedensel dil modelleme, bir modelin bir metindeki bir sonraki token''ı yalnızca kendisinden önce gelen token''lara bakarak tahmin etmesidir. GPT ailesindeki modellerin temel eğitim hedefi budur. "Nedensel" kelimesi buradaki kritik kısıtı anlatır: model geleceği göremez, sadece geçmişe bakar.
Nasıl çalışır?
Model bir cümleyi soldan sağa okur. Her adımda elindeki token dizisine bakıp bir sonraki token için bir olasılık dağılımı üretir. Eğitim sırasında doğru cevap zaten metinde vardır; model tahminini gerçek token''la karşılaştırır ve hatasını geri yayar (backpropagation).
Bunu mümkün kılan şey attention katmanındaki nedensel maske (causal mask): her token yalnızca kendinden önceki token''lara dikkat edebilir, sonrakiler maskelenir. Bu sayede model eğitim sırasında "kopya çekemez", cevabı görmeden tahmin etmek zorunda kalır.
Maskeli dil modellemeden (masked language modeling, BERT''in yaptığı) farkı tam olarak burada: BERT cümlenin ortasındaki boşluğu iki yönden de bağlama bakarak doldurur; nedensel model ise sadece tek yön, geçmişten geleceğe çalışır. Bu yüzden nedensel modeller metin üretmeye çok daha uygundur.
Neden önemli?
Bugün kullandığın sohbet asistanlarının, kod tamamlama araçlarının ve metin üreticilerin neredeyse tamamı nedensel dil modelleme ile eğitilmiştir. Tek yönlü yapısı, modelin token token, tutarlı bir şekilde metin üretmesini sağlar — tıpkı yazarken bir sonraki kelimeyi tahmin eder gibi. Autoregressive (özbağlanımlı) üretim dediğimiz şeyin de temeli budur.
Kullanım alanları
Sohbet botları, kod üretimi, otomatik tamamlama, hikâye ve metin yazımı, özetleme, çeviri gibi üretken görevlerin çoğu. Kısacası bir modelin "yazabilmesi" isteniyorsa, büyük ihtimalle nedensel dil modelleme ile eğitilmiştir.
Ilgili terimler
