Eğitim Verisi (Training Data)
Veri & eğitimEğitim verisi nedir?
Bir modelin öğrenme sürecinde işlediği örneklerin bütünü. Bir dil modeli için bu; kitaplar, web sayfaları, kod depoları ve sohbet kayıtları gibi milyarlarca metin parçası olabilir. Model bu veriden örüntüleri çıkarır ve ağırlıklarına kaydeder. Kısaca: model neyi gördüyse onu bilir.
Eğitim verisi, test verisinden ayrıdır. Model eğitim verisiyle öğrenir, hiç görmediği test verisiyle sınanır. İkisi karışırsa "data leakage" oluşur ve modelin gerçek başarısı olduğundan yüksek görünür.
Nasıl çalışır?
Ham veri önce toplanır, sonra temizlenir: tekrar edenler atılır, zararlı içerik filtrelenir, format düzeltilir (bu adıma data preprocessing denir). Ardından veri token'lara bölünür ve modele partiler halinde verilir. Model her örnekte tahminini gerçek cevapla karşılaştırır, hatasını ölçer ve ağırlıklarını backpropagation ile günceller.
Verinin miktarı kadar dağılımı da önemli. Bir dile ya da konuya az yer verilmişse, model o alanda zayıf kalır. Türkçe içeriğin eğitim setlerinde İngilizceye göre az olması, birçok modelin Türkçede neden daha zayıf olduğunu büyük ölçüde açıklar.
Neden önemli?
Modelin önyargıları, bilgi sınırı ve güçlü-zayıf yanları büyük oranda eğitim verisinden gelir. Kötü ya da taraflı veri, kötü model üretir — buna "çöp girer, çöp çıkar" denir. Ayrıca telif ve gizlilik tartışmalarının çoğu, bir modelin hangi veriyle eğitildiği sorusunun etrafında döner.
Kullanım alanları
Yeni bir modeli sıfırdan eğitmek (pretraining), mevcut bir modeli belli bir göreve uyarlamak (fine-tuning) ve sentetik veri üreterek eksik alanları doldurmak — hepsi eğitim verisinin nasıl seçildiğine ve hazırlandığına bağlıdır.
Ilgili terimler
