Aktör-Kritik (Actor-Critic)
Araç kavramlarıAktör-Kritik nedir?
Aktör-kritik, pekiştirmeli öğrenmenin (reinforcement learning) en yaygın yöntem ailelerinden biri. Adı üstünde iki parça var: bir "aktör" ve bir "kritik". Aktör kararları verir — yani bir durumda hangi aksiyonu seçeceğini belirler. Kritik ise bu kararları izler ve "bu hamle beklediğinden iyiydi" ya da "kötüydü" diye geri bildirim verir. İki ağ birlikte öğrenir; aktör kritiğin puanına göre kendini düzeltir.
Nasıl çalışır?
Klasik pekiştirmeli öğrenmede iki temel yaklaşım vardır: sadece aksiyonun olasılığını öğrenen politika-temelli yöntemler ve her durumun değerini tahmin eden değer-temelli yöntemler. Aktör-kritik ikisini birleştirir. Aktör, politikayı (policy) temsil eder ve olasılık dağılımı üretir. Kritik, değer fonksiyonunu (value function) tahmin eder ve "avantaj" (advantage) denen bir sinyal hesaplar: seçilen aksiyon, ortalama beklentiden ne kadar iyiydi? Aktör bu avantaj sinyaliyle güncellenir — pozitifse o davranışı pekiştirir, negatifse azaltır. Kritik ise gördüğü ödüllerle kendi tahminini keskinleştirir. Bu döngü, saf politika-gradyan yöntemlerindeki yüksek gürültüyü azaltır ve öğrenmeyi stabilize eder.
Neden önemli?
Modern pekiştirmeli öğrenmenin belkemiği. PPO gibi bugün dil modellerini RLHF ile hizalarken kullanılan algoritmalar da aktör-kritik ailesinden gelir. Kritik olmadan aktör tek başına çok yavaş ve dengesiz öğrenir; aktör olmadan kritik sadece değerlendirir ama karar veremez. İkisinin iş bölümü, karmaşık ortamlarda öğrenmeyi iş görür hale getirir.
Kullanım alanları
Oyun oynayan ajanlar, robot kontrolü, otonom sistemler ve büyük dil modellerinin insan geri bildirimiyle hizalanması (RLHF). Bir chatbot'un cevaplarını insan tercihlerine göre ayarlamak da perde arkasında çoğu zaman aktör-kritik temelli bir optimizasyonla olur.
Ilgili terimler
