Bellman Denklemi (Bellman Equation)
Araç kavramlarıBellman Denklemi nedir?
Bellman denklemi (Bellman equation), 1950'lerde matematikçi Richard Bellman tarafından dinamik programlama çalışmaları sırasında geliştirilen ve pekiştirmeli öğrenmenin temelini oluşturan bir denklemdir. Temel fikri şudur: Bir durumda olmanın değeri, o durumda atacağın adımdan hemen alacağın ödül ile varacağın bir sonraki durumun değerinin toplamına eşittir.
Günlük bir örnek: Bir iş teklifinin değerini düşün. Bu değer sadece ilk maaştan ibaret değildir; o işin seni götüreceği sonraki kariyer basamaklarının değerini de içerir. Bellman denklemi, bu "şimdi + gelecek" hesabını matematiksel olarak ifade eder.
Nasıl çalışır?
Denklemin iki temel bileşeni vardır:
- Anlık ödül: Mevcut durumda seçilen eylemle hemen elde edilen ödül.
- İndirimli gelecek değer: Bir sonraki durumun değeri, 0 ile 1 arasında bir indirim katsayısıyla (gamma) çarpılarak eklenir. Gamma, gelecekteki ödüllerin bugünkü ödüllere göre ne kadar önemsendiğini belirler. 0'a yakınsa ajan kısa vadeli düşünür, 1'e yakınsa uzun vadeli.
Denklemin güzelliği özyinelemeli olmasıdır: Büyük bir problemi, "bir adım + geri kalan problem" şeklinde küçük parçalara böler. Bu sayede sonsuz uzunluktaki bir geleceği hesaplamak yerine sadece bir adım ileriye bakmak yeterli olur.
Denklemin iki formu yaygındır. Değer fonksiyonu formu, belirli bir politika izlendiğinde bir durumun ne kadar değerli olduğunu söyler. Optimal form ise en iyi eylem seçildiğinde ulaşılabilecek en yüksek değeri tanımlar ve bu, optimal politikayı bulmanın anahtarıdır.
Q-learning, bu optimal Bellman denklemini deneyimden adım adım öğrenmeye çalışır. Her adımda mevcut tahmin ile "anlık ödül + sonraki durumun en iyi tahmini" arasındaki farka göre güncelleme yapılır. Bu farka temporal difference (TD) hatası denir.
Neden önemli?
Bellman denklemi, pekiştirmeli öğrenme algoritmalarının neredeyse hepsinin arkasındaki matematiksel temeldir. Değer iterasyonu, politika iterasyonu, Q-learning, DQN ve actor-critic yöntemlerinin eleştirmen kısmı bu denkleme dayanır. Ayrıca ekonomi, yöneylem araştırması ve kontrol teorisinde sıralı karar problemlerinin çözümünde de kullanılır.
Kullanım alanları
- Pekiştirmeli öğrenme: Değer fonksiyonlarını ve Q-değerlerini öğrenmek.
- Dinamik programlama: En kısa yol, stok yönetimi ve kaynak tahsisi problemleri.
- Ekonomi: Tüketim ve yatırım kararlarının zaman içindeki optimizasyonu.
- Robotik ve kontrol: Uzun vadeli hedeflere ulaşan kontrol politikaları tasarlamak.
- Oyunlar: Hamlelerin uzun vadeli değerini tahmin etmek.
Ilgili terimler
