Model Kapasitesi (Model Capacity)
Araç kavramlarıModel Kapasitesi nedir?
Model kapasitesi (model capacity), bir modelin öğrenebileceği fonksiyonların ne kadar karmaşık olabileceğini anlatan kavramdır. Basitçe söylemek gerekirse, modelin "hafıza ve esneklik bütçesi"dir. Düz bir çizgi çizebilen doğrusal regresyonun kapasitesi düşüktür; milyarlarca parametreli bir sinir ağının kapasitesi ise devasadır.
Kapasite genellikle parametre sayısı, katman sayısı ve modelin yapısıyla ilişkilidir, ama birebir aynı şey değildir. Mimarinin nasıl kurulduğu, hangi aktivasyon fonksiyonlarının kullanıldığı da kapasiteyi etkiler.
Nasıl çalışır?
Bir veri kümesinin arkasında bir gerçek örüntü olduğunu düşün. Modelin kapasitesi bu örüntüyü yakalamaya yetmiyorsa, model hem eğitim hem test verisinde kötü sonuç verir; buna underfitting denir. Kapasite gereğinden fazlaysa, model gerçek örüntünün yanında verideki gürültüyü ve tesadüfleri de öğrenir; eğitim verisinde parlar, yeni veride çuvallar. Bu da overfitting'dir.
İdeal durum, kapasitenin problemin zorluğuna ve eldeki veri miktarına uygun olmasıdır. Az veriyle devasa bir model eğitmek, bir öğrenciye üç soruluk bir sınavı ezberletmeye benzer: sınavı geçer ama konuyu öğrenmez.
Kapasiteyi kontrol etmenin yolları var. Regularization, dropout ve weight decay, modelin elindeki kapasiteyi "dizginler". Early stopping, modelin ezberlemeye başladığı noktada eğitimi keser. Veri miktarını artırmak da kapasiteyi daha verimli kullanmayı sağlar.
Neden önemli?
Model kapasitesi, bias-variance dengesinin tam kalbinde durur. Model seçerken sorulması gereken soru "en büyük model hangisi?" değil, "bu problem ve bu veri için doğru kapasite ne?" olmalıdır. Büyük dil modelleri dünyasında scaling laws da aslında kapasite, veri ve hesaplama gücü arasındaki dengeyi anlatır. İlginç bir şekilde, çok büyük modellerde klasik overfitting sezgileri her zaman tutmaz; bu da kapasite konusunu araştırmacılar için hâlâ canlı tutuyor.
Kullanım alanları
- Model seçimi: Problemin karmaşıklığına göre küçük ya da büyük mimari tercihi.
- Hata teşhisi: Eğitim ve test başarısı arasındaki farktan underfitting/overfitting okumak.
- Kaynak planlaması: Gereksiz büyük model, gereksiz GPU faturası demek.
- Distillation: Büyük modelin bilgisini daha düşük kapasiteli bir modele aktarmak.
- Öğrenme eğrisi okumak: Eğitim ve doğrulama loss'unu aynı grafikte izlemek, kapasitenin yetersiz mi yoksa fazla mı olduğunu gösteren en pratik yöntemdir. İki eğri birlikte yüksek kalıyorsa kapasite az, aralarındaki makas açılıyorsa fazla demektir.
Ilgili terimler
