Politika Gradyanı (Policy Gradient)
Araç kavramlarıPolitika gradyanı nedir?
Politika gradyanı, reinforcement learning'de bir ajanın nasıl davranacağını belirleyen politikayı (policy) doğrudan optimize eden yöntemler ailesidir. "Politika" burada ajanın hangi durumda hangi aksiyonu ne olasılıkla seçeceğini söyleyen fonksiyondur. Q-learning gibi değer temelli yöntemler önce her aksiyonun değerini hesaplayıp sonra ona göre davranırken, politika gradyanı bu ara adımı atlar: doğrudan "iyi sonuç veren aksiyonların olasılığını artır, kötülerinkini azalt" der.
Nasıl çalışır?
Ajan politikasına göre bir dizi aksiyon dener ve topladığı ödülü ölçer. Sonra gradient ascent ile politikanın parametrelerini, yüksek ödül getiren aksiyonların olasılığı artacak yönde günceller. Temel algoritma REINFORCE'tur; ama ham haliyle çok gürültülüdür, öğrenme yavaş ve dengesiz olur. Bu yüzden pratikte baseline çıkarma, avantaj (advantage) hesabı ve actor-critic yapısı devreye girer — bir ağ politikayı (actor), diğeri değer tahminini (critic) öğrenir. Bugün en yaygın kullanılan PPO da bu ailenin, güncellemeleri fazla sertleşmesin diye kısıtlayan gelişmiş bir üyesidir.
Neden önemli?
Politika gradyanı, sürekli (continuous) aksiyon uzaylarında ve stokastik politikaların gerektiği yerlerde değer temelli yöntemlerin tıkandığı noktayı açar — robot eklem kontrolü gibi neredeyse sonsuz aksiyon seçeneği olan problemler bunun sahası. Ayrıca büyük dil modellerinin RLHF ile hizalanmasında kullanılan PPO'nun temeli tam olarak burasıdır; yani sohbet modellerinin "kibar" davranmayı öğrenmesinin arkasında politika gradyanı mantığı var.
Kullanım alanları
Robotik (yürüme, kavrama), oyun ajanları, otonom sistemlerin karar verme katmanı, öneri sistemlerinin uzun vadeli optimizasyonu ve en görünür yeriyle LLM'lerin RLHF ile hizalanması. Bir modelin insan geri bildirimine göre ince ayarlandığı her yerde bu yöntemin izini bulabilirsin.
Ilgili terimler
