Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Deneyim Tekrarı (Experience Replay)

Araç kavramları
Ing: Experience ReplaySon güncelleme: 25 Eylül 2026
Ajanın geçmiş deneyimlerini bir hafızada saklayıp eğitimde rastgele örnekleyerek yeniden kullanması. Eski maçların kasetlerini tekrar izlemek gibi.

Deneyim Tekrarı nedir?

Deneyim tekrarı (experience replay), pekiştirmeli öğrenmede ajanın yaşadığı deneyimleri bir hafıza tamponunda (replay buffer) saklaması ve eğitim sırasında bu hafızadan rastgele örnekler çekerek öğrenmesi tekniğidir. Her deneyim genellikle dört parçadan oluşur: mevcut durum, seçilen eylem, alınan ödül ve varılan yeni durum.

Bir sporcunun sadece o anki maçtan değil, geçmiş maçların kayıtlarını izleyerek de öğrenmesine benzer. Deneyim bir kez yaşanır ama defalarca ders çıkarılır.

Nasıl çalışır?

Süreç şu şekilde işler:

  • Toplama: Ajan ortamla etkileşime girdikçe her adımı hafıza tamponuna ekler.
  • Saklama: Tampon belirli bir kapasiteye sahiptir (örneğin bir milyon deneyim). Dolduğunda en eski deneyimler silinir.
  • Örnekleme: Her eğitim adımında tampondan rastgele bir mini-batch deneyim seçilir.
  • Öğrenme: Ajanın sinir ağı bu rastgele örneklerle güncellenir.

Bu yaklaşım iki önemli sorunu çözer. Birincisi, ardışık deneyimler birbirine çok benzer ve güçlü şekilde ilişkilidir. Bir oyunda art arda gelen kareler neredeyse aynıdır. Sinir ağları birbirine bağımlı verilerle eğitildiğinde kararsızlaşır; rastgele örnekleme bu bağımlılığı kırar ve veriyi i.i.d. varsayımına yaklaştırır. İkincisi, veri verimliliğini artırır: Her deneyim tek kullanımlık değildir, birçok kez öğrenmede kullanılabilir.

Geliştirilmiş bir versiyon olan öncelikli deneyim tekrarı (prioritized experience replay), her deneyimi eşit olasılıkla seçmek yerine, ajanın en çok şaşırdığı (tahmin hatası en büyük olan) deneyimleri daha sık seçer. Böylece öğrenilecek en çok şey olan anlar daha fazla tekrar edilir.

Neden önemli?

Deneyim tekrarı, derin pekiştirmeli öğrenmenin kararlı çalışmasını sağlayan kilit tekniklerden biridir. DQN'in Atari oyunlarında insan seviyesine ulaşmasında, hedef ağ (target network) ile birlikte en önemli iki bileşenden biriydi. Deneyim tekrarı yalnızca off-policy algoritmalarda doğrudan kullanılabilir, çünkü ajan eski politikasıyla toplanmış verilerden öğrenir.

Beyin bilimiyle de ilginç bir paralelliği var: Uyku sırasında hipokampüsün gün içindeki deneyimleri "tekrar oynattığı" ve bunun öğrenmeyi pekiştirdiği düşünülüyor.

Kullanım alanları

  • Derin Q-öğrenme: DQN ve türevlerinde standart bileşen.
  • Robotik: Gerçek dünyada toplanması pahalı deneyimlerden maksimum fayda sağlamak.
  • Sürekli öğrenme: Eski görevlerden örnekler saklayarak catastrophic forgetting'i azaltmak.
  • Off-policy actor-critic yöntemleri: Sürekli eylem uzaylı kontrol problemleri.
  • Oyun ajanları: Uzun eğitim süreçlerinde veri verimliliğini artırmak.
mindi
mindi'nin notu
Deneyim tekrarı, "bir kere yaşa, çok kez öğren" prensibi. İnsanlar için de geçerli: Dünkü hatayı bugün bir kez daha düşünmek, yeni bir hata yapmaktan çok daha ucuz.