Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Epsilon-Greedy (Epsilon-Greedy Policy)

Araç kavramları
Ing: Epsilon-Greedy PolicySon güncelleme: 25 Eylül 2026
Çoğu zaman en iyi bilinen eylemi seçip küçük bir olasılıkla rastgele eylem deneyen keşif stratejisi. Arada bir yeni restoran denemek gibi.

Epsilon-Greedy nedir?

Epsilon-greedy, pekiştirmeli öğrenmede keşif ile sömürü (exploration-exploitation) arasındaki dengeyi kurmanın en basit ve en yaygın yoludur. Ajan çoğu zaman o ana kadar öğrendiği en iyi eylemi seçer (greedy, yani açgözlü davranır), ama epsilon adı verilen küçük bir olasılıkla tamamen rastgele bir eylem dener.

Günlük hayattan bir örnek: Her öğlen yemeği için bildiğin en iyi lokantaya gidiyorsun. Ama ayda bir, yüzde 10 ihtimalle, hiç denemediğin bir yere gidiyorsun. Çoğu zaman bildiğin iyi yemeği yersin, arada bir de belki daha iyisini keşfedersin.

Nasıl çalışır?

Her karar anında ajan 0 ile 1 arasında rastgele bir sayı çeker:

  • Sayı epsilon'dan küçükse: Olası eylemlerden birini rastgele seçer. Bu keşiftir.
  • Sayı epsilon'dan büyükse: Mevcut bilgisine göre en yüksek değere sahip eylemi seçer. Bu sömürüdür.

Epsilon 0,1 ise ajan zamanın yaklaşık yüzde 90'ında en iyi bildiği eylemi, yüzde 10'unda rastgele bir eylemi seçer.

Pratikte epsilon genellikle sabit tutulmaz. Eğitimin başında ajan dünya hakkında hiçbir şey bilmediği için epsilon yüksek başlar (örneğin 1, yani tamamen rastgele). Eğitim ilerledikçe ve ajanın tahminleri güvenilir hale geldikçe epsilon kademeli olarak azaltılır (örneğin 0,01'e kadar). Buna epsilon decay denir.

Yöntemin bir zaafı, keşfin tamamen rastgele olmasıdır. Ajan açıkça kötü olduğunu bildiği eylemleri de, neredeyse en iyi olan eylemleri de aynı olasılıkla dener. Softmax tabanlı seçim, belirsizliğe dayalı keşif (UCB) ve Thompson sampling gibi yöntemler daha akıllıca keşif yapar, ama epsilon-greedy basitliği ve güvenilirliği sayesinde hâlâ çok yaygın.

Neden önemli?

Hiç keşif yapmayan bir ajan, erken aşamada şansla iyi görünen bir eyleme takılıp kalabilir ve daha iyi seçenekleri asla öğrenemez. Sürekli keşif yapan bir ajan ise öğrendiklerini hiç kullanmaz. Epsilon-greedy, bu dengeyi tek bir sayıyla kontrol edilebilir hale getirir. DQN gibi dönüm noktası niteliğindeki algoritmalar da keşif için bu stratejiyi kullandı.

Kullanım alanları

  • Pekiştirmeli öğrenme: Q-learning ve DQN gibi değer tabanlı algoritmalarda keşif stratejisi.
  • Çok kollu haydut (multi-armed bandit) problemleri: Birden fazla seçenek arasından en iyisini deneyerek bulmak.
  • A/B testleri ve öneri sistemleri: Trafiğin küçük bir kısmını yeni seçeneklere yönlendirerek keşif yapmak.
  • Reklam optimizasyonu: Farklı reklam varyasyonlarını dengeli şekilde test etmek.
  • Oyun ajanları: Eğitim sırasında farklı stratejileri denemek.
mindi
mindi'nin notu
Epsilon-greedy'nin hayata dair mesajı güzel: Çoğunlukla bildiğin iyi şeyi yap, ama arada bir bilinmeyeni dene. Hiç denemezsen daha iyisini asla bulamazsın.