Model Paralelliği (Model Parallelism)
MimariModel Paralelliği nedir?
Model paralelliği (model parallelism), tek bir GPU'nun belleğine sığmayacak kadar büyük bir modeli parçalara ayırıp bu parçaları farklı GPU'lara yerleştirme tekniğidir. Modern büyük dil modelleri yüz milyarlarca parametreye ulaştığında tek kart yetmez; model fiziksel olarak bölünür.
Nasıl çalışır?
İki ana yaklaşım var. Tensör paralelliğinde (tensor parallelism) tek bir katmanın matris çarpımları GPU'lar arasında bölünür — her kart hesabın bir dilimini yapar, sonuçlar birleştirilir. Pipeline paralelliğinde ise modelin katmanları gruplara ayrılıp her grup farklı GPU'ya konur; veri bir montaj hattı gibi kartlar arasında akar. Bunlar genelde veri paralelliğiyle (data parallelism) birlikte kullanılır. Megatron-LM ve DeepSpeed bu yaklaşımları yaygınlaştıran framework'lerdir.
Neden önemli?
Model paralelliği olmadan GPT ölçeğindeki modelleri eğitmek ya da çalıştırmak imkânsızdır. Belleği tek karta sığmayan modeli mümkün kılar, eğitimi hızlandırır ve devasa modellerin inference'ını pratikleştirir. Fine-tuning yaparken veya kendi sunucunda büyük model çalıştırırken seçtiğin paralellik stratejisi hem hıza hem maliyete doğrudan yansır.
Kullanım alanları
Büyük dil modeli ön eğitimi (pretraining), yüz milyar+ parametreli modellerin inference'ı, çok GPU'lu sunucularda dağıtık eğitim, bulut sağlayıcıların model servis altyapıları. GPU offload ve quantization ise sınırlı donanımda benzer sorunu farklı açıdan çözer — model paralelliği bölerek, onlar sıkıştırarak.
Ilgili terimler
