Eğitim-Test Ayrımı (Train-Test Split)
Veri & eğitimEğitim-Test Ayrımı nedir?
Bir makine öğrenmesi modeli kurduğunda elindeki veriyi ikiye (çoğu zaman üçe) bölersin: modelin öğrendiği eğitim seti ve modelin daha önce hiç görmediği test seti. Amaç basit — modelin gerçekten öğrenip öğrenmediğini, yoksa sadece ezberleyip ezberlemediğini anlamak.
Sınava çalışan bir öğrenci düşün. Çıkmış sorularla çalışması iyi, ama sınavda aynen o soruları görmesi onun ne kadar öğrendiğini göstermez. Test seti, modele daha önce görmediği "yeni sorular" sormaktır.
Nasıl çalışır?
Tipik oran %80 eğitim, %20 test şeklindedir ama veri boyutuna göre değişir. Sıralama şöyle işler:
- Veri rastgele karıştırılır (zaman serisi gibi sıralı verilerde bu adım atlanır).
- Bir kısmı eğitime, bir kısmı teste ayrılır.
- Model sadece eğitim setini görür, ağırlıklarını ona göre günceller.
- Test seti sadece en sonda, tek seferlik performans ölçümü için kullanılır.
Çoğu ciddi projede araya bir de doğrulama (validation) seti girer: hiperparametre ayarları test setine "sızmasın" diye. Test seti kutsaldır — ona ne kadar az bakarsan sonuçların o kadar dürüst olur.
Neden önemli?
Eğitim ve test verisini ayırmazsan modelin ezberlediğini gelişme sanarsın. Eğitim verisinde %99 doğruluk alıp gerçek dünyada çuvallayan modellerin sebebi neredeyse her zaman budur — buna aşırı öğrenme (overfitting) denir. Test seti, bu yanılsamayı kıran tek dürüst aynadır.
Bir de veri sızıntısı (data leakage) tuzağı var: test verisinden bir bilgi kazara eğitime karışırsa skorların gerçek dışı yükselir. Ayrımı temiz yapmak bu yüzden titizlik ister.
Kullanım alanları
Sınıflandırma, regresyon, dil modeli değerlendirmesi — velhasıl gözetimli öğrenmenin (supervised learning) yapıldığı her yerde ilk adımdır. Küçük veri setlerinde tek bir ayrım yetmez, çapraz doğrulama (cross-validation) ile birden çok kez farklı bölünmeler denenir.
Ilgili terimler
