⚡ Öne ÇıkanBilgisayarımda hangi ücretsiz yapay zeka çalışır?

Aktör-Kritik (Actor-Critic)

Araç kavramları
Ing: Actor-CriticSon güncelleme: 24 Ağustos 2026
Pekiştirmeli öğrenmede iki ağın iş bölümü: aktör hangi aksiyonu seçeceğine karar verir, kritik o kararın ne kadar iyi olduğunu puanlar.

Aktör-Kritik nedir?

Aktör-kritik, pekiştirmeli öğrenmenin (reinforcement learning) en yaygın yöntem ailelerinden biri. Adı üstünde iki parça var: bir "aktör" ve bir "kritik". Aktör kararları verir — yani bir durumda hangi aksiyonu seçeceğini belirler. Kritik ise bu kararları izler ve "bu hamle beklediğinden iyiydi" ya da "kötüydü" diye geri bildirim verir. İki ağ birlikte öğrenir; aktör kritiğin puanına göre kendini düzeltir.

Nasıl çalışır?

Klasik pekiştirmeli öğrenmede iki temel yaklaşım vardır: sadece aksiyonun olasılığını öğrenen politika-temelli yöntemler ve her durumun değerini tahmin eden değer-temelli yöntemler. Aktör-kritik ikisini birleştirir. Aktör, politikayı (policy) temsil eder ve olasılık dağılımı üretir. Kritik, değer fonksiyonunu (value function) tahmin eder ve "avantaj" (advantage) denen bir sinyal hesaplar: seçilen aksiyon, ortalama beklentiden ne kadar iyiydi? Aktör bu avantaj sinyaliyle güncellenir — pozitifse o davranışı pekiştirir, negatifse azaltır. Kritik ise gördüğü ödüllerle kendi tahminini keskinleştirir. Bu döngü, saf politika-gradyan yöntemlerindeki yüksek gürültüyü azaltır ve öğrenmeyi stabilize eder.

Neden önemli?

Modern pekiştirmeli öğrenmenin belkemiği. PPO gibi bugün dil modellerini RLHF ile hizalarken kullanılan algoritmalar da aktör-kritik ailesinden gelir. Kritik olmadan aktör tek başına çok yavaş ve dengesiz öğrenir; aktör olmadan kritik sadece değerlendirir ama karar veremez. İkisinin iş bölümü, karmaşık ortamlarda öğrenmeyi iş görür hale getirir.

Kullanım alanları

Oyun oynayan ajanlar, robot kontrolü, otonom sistemler ve büyük dil modellerinin insan geri bildirimiyle hizalanması (RLHF). Bir chatbot'un cevaplarını insan tercihlerine göre ayarlamak da perde arkasında çoğu zaman aktör-kritik temelli bir optimizasyonla olur.

mindi
mindi'nin notu
aktör karar verir, kritik puan verir — biri olmadan olmuyor. bugün dil modellerini hizalayan ppo da bu ailenin çocuğu.