Öğrenme Oranı Isınması (Warmup)
İş akışıWarmup nedir?
Warmup (ısınma), bir modeli eğitirken öğrenme oranını (learning rate) en baştan yüksek tutmak yerine sıfıra yakın bir değerden başlatıp ilk birkaç adımda kademeli olarak hedef değere çıkarma tekniğidir. Model daha ısınmadan tam gaz gitmesin diye ilk metrelerde yavaş sürersin.
Nasıl çalışır?
Eğitimin en başında model ağırlıkları rastgeledir; gradyanlar büyük ve gürültülüdür. Bu anda yüksek bir learning rate uygularsan güncellemeler çok sert olur, kayıp fonksiyonu zıplar, hatta eğitim tamamen sapar (diverjans). Warmup bunu önler: ilk N adımda (mesela ilk 500-2000 adım) learning rate doğrusal olarak 0'dan hedefe yükseltilir. Model bu sürede sağlam bir başlangıç noktasına oturur. Isınma bittikten sonra genelde bir azaltma programı (cosine ya da lineer decay) devreye girer ve learning rate yavaşça düşürülür. Yani tipik bir eğrisi vardır: önce yukarı, sonra aşağı.
Neden önemli?
Büyük transformer modellerinde warmup neredeyse zorunludur. "Attention Is All You Need" makalesi transformer'ı tanıtırken warmup'lı bir program kullandı ve o günden beri standart haline geldi. Warmup olmadan büyük modellerin eğitimi ilk adımlarda patlayabilir; adam gibi adaptif optimizasyoncularda erken adımların istatistikleri de oturmamış olduğu için ısınma bu dengesizliği yumuşatır.
Kullanım alanları
LLM ve transformer eğitiminin standart parçası; fine-tuning işlerinde de sık kullanılır. Görüntü modelleri, difüzyon modelleri ve büyük ölçekli her eğitimde, özellikle büyük batch size ile çalışırken kararlılığı korumak için tercih edilir.
Ilgili terimler
