Politika (Policy)
Araç kavramlarıPolitika nedir?
Pekiştirmeli öğrenmede politika (policy), bir ajanın içinde bulunduğu duruma bakarak hangi eylemi seçeceğini belirleyen kuraldır. Matematiksel olarak durumlardan eylemlere giden bir fonksiyondur. Satranç oynayan bir ajan için politika, tahtadaki dizilime bakıp hangi hamlenin yapılacağını söyler; bir robot için ise sensör okumasına göre hangi motorun ne kadar döneceğini.
Pekiştirmeli öğrenmenin nihai amacı, uzun vadede toplam ödülü en yükseğe çıkaran politikayı bulmaktır. Buna optimal politika denir.
Nasıl çalışır?
Politikalar iki ana türde olabilir:
- Deterministik politika: Her durum için tek bir eylem seçer. "Bu durumda her zaman sola dön."
- Stokastik politika: Her durum için eylemler üzerinde bir olasılık dağılımı üretir. "Bu durumda yüzde 70 sola, yüzde 30 sağa." Stokastik politikalar keşif yapmayı kolaylaştırır ve rakibin tahmin edemeyeceği davranışlar gerektiren oyunlarda avantaj sağlar.
Politikayı öğrenmenin iki büyük yolu var. Değer tabanlı yöntemlerde (Q-learning gibi) önce her durum ve eylemin ne kadar değerli olduğu öğrenilir, politika bu değerlerden türetilir: en yüksek değerli eylemi seç. Politika tabanlı yöntemlerde (policy gradient gibi) ise politika doğrudan bir sinir ağı olarak parametrelenir ve ödülü artıracak yönde güncellenir. Actor-critic yöntemleri bu ikisini birleştirir: aktör politikayı, eleştirmen değer fonksiyonunu öğrenir.
Politikayla değerlendirilen ve politikayla veri toplanan ayrımı da önemli: on-policy yöntemler sadece mevcut politikanın ürettiği veriden öğrenirken, off-policy yöntemler başka bir politikayla toplanmış veriden de öğrenebilir.
Neden önemli?
Politika, pekiştirmeli öğrenmenin çıktısıdır; eğitim bittiğinde elinde kalan şey odur. Büyük dil modellerinin RLHF ile hizalanmasında da dil modeli bir politika olarak ele alınır: durum, o ana kadarki metin; eylem, üretilecek bir sonraki token. PPO veya benzeri algoritmalar bu politikayı ödül modeline göre ayarlar.
Kullanım alanları
- Oyunlar: Masa oyunlarından video oyunlarına kadar karar veren ajanlar.
- Robotik: Yürüme, kavrama ve navigasyon kontrolü.
- LLM hizalaması: RLHF ve türevlerinde modelin davranışını şekillendirmek.
- Öneri sistemleri: Kullanıcıya hangi içeriğin gösterileceğine karar veren uzun vadeli stratejiler.
- Kaynak yönetimi: Veri merkezi soğutması, trafik ışıkları ve enerji dağıtımı gibi sıralı karar problemleri.
Ilgili terimler
