RMS Normalizasyonu (RMSNorm)
MimariRMS normalization nedir?
Derin ağlarda katmandan katmana geçerken sayılar aşırı büyüyüp küçülebilir; normalizasyon bunu dengeler ve eğitimi stabil tutar. RMSNorm (RMS normalizasyonu), bir vektörü kendi kök ortalama karesine (root mean square) bölerek ölçekleyen sade bir yöntemdir.
Klasik layer normalization'dan farkı: layer norm önce ortalamayı çıkarıp (merkezleme) sonra ölçekler; RMSNorm merkezleme adımını atar, sadece büyüklüğe göre normalize eder.
Nasıl çalışır?
RMSNorm bir vektördeki değerlerin karelerinin ortalamasını alır, karekökünü bulur ve her elemanı bu sayıya böler. Ardından öğrenilen bir ölçek parametresiyle (gain) çarpar. Ortalama çıkarma ve kaydırma (bias) adımları olmadığı için hesap daha az; büyük modellerde her katmanda kazanılan bu küçük tasarruf toplamda ciddi hıza dönüşür.
Sonuç pratikte layer norm'a çok yakın kalite verir ama daha ucuzdur — bu yüzden modern transformer'ların favorisi olmuştur.
Neden önemli?
Büyük dil modelleri onlarca hatta yüzlerce katmandan oluşur ve her katmanda normalizasyon çalışır. Buradaki küçük bir sadeleştirme, milyarlarca parametreli bir modelde hem eğitim hem çıkarım maliyetini düşürür. RMSNorm'un yaygınlaşması, "daha az işlemle aynı stabiliteyi yakala" mantığının güzel bir örneğidir.
Kullanım alanları
RMSNorm bugün açık kaynak LLM'lerin büyük kısmında varsayılan normalizasyon katmanıdır; rotary embedding ve SwiGLU gibi diğer modern bileşenlerle birlikte adeta standart transformer reçetesinin parçası olmuştur. Yeni bir model mimarisi incelediğinde "layer norm mı RMSNorm mı" ayrımı, o modelin ne kadar modern bir tarife oturduğunun küçük ama net bir işaretidir.
Ilgili terimler
