Ortam (Environment)
Araç kavramlarıOrtam nedir?
Pekiştirmeli öğrenmede ortam (environment), ajanın dışında kalan ve ajanın etkileşime girdiği her şeydir. Ajan bir eylem yapar, ortam bu eyleme tepki verir: yeni bir duruma geçer ve ajana bir ödül (ya da ceza) sinyali gönderir. Pekiştirmeli öğrenmenin tamamı, bu ajan-ortam döngüsü üzerine kuruludur.
Bir satranç ajanı için ortam, tahta ve rakibin hamleleridir. Bir robot süpürge için ortam, evin kendisidir. Bir dil modeli ajanı için ortam; web tarayıcısı, terminal ya da bir yazılım arayüzü olabilir.
Nasıl çalışır?
Her adımda şu döngü tekrarlanır:
- Gözlem: Ajan ortamın mevcut durumunu (ya da onun bir kısmını) gözlemler.
- Eylem: Ajan politikasına göre bir eylem seçer.
- Geçiş: Ortam, bu eyleme göre yeni bir duruma geçer.
- Ödül: Ortam, bu geçişin ne kadar iyi olduğunu söyleyen bir ödül sinyali üretir.
Ortamlar farklı özelliklerine göre sınıflandırılır:
- Tam gözlemlenebilir / kısmen gözlemlenebilir: Satrançta tahtanın tamamı görünür. Pokerde rakibin kartları görünmez.
- Deterministik / stokastik: Aynı eylem her zaman aynı sonucu mu verir, yoksa işin içinde şans mı var?
- Ayrık / sürekli: Eylemler sınırlı bir listeden mi seçilir (sol, sağ, zıpla), yoksa sürekli değerler mi alır (direksiyonu 12,5 derece çevir)?
- Tek ajanlı / çok ajanlı: Ortamda başka öğrenen ajanlar da var mı?
Matematiksel olarak ortam genellikle bir Markov karar süreci (MDP) olarak modellenir.
Neden önemli?
Ajanın öğrenebileceği şey, ortamın ona sunduğu deneyimle sınırlıdır. Ortam tasarımı, özellikle ödül fonksiyonunun tanımı, pekiştirmeli öğrenmenin en kritik ve en zor kısmıdır. Yanlış tasarlanmış bir ödül, ajanın beklenmedik kestirmeler bulmasına (reward hacking) yol açabilir.
Gerçek dünya ortamlarında deneme-yanılma pahalı ve bazen tehlikelidir. Bu yüzden ajanlar önce simülasyonlarda eğitilir, sonra gerçek dünyaya aktarılır. Simülasyon ile gerçeklik arasındaki farka "sim-to-real gap" denir. Son yıllarda dil modeli ajanlarının eğitimi için de kod çalıştırma, web gezinme ve araç kullanma ortamları geliştiriliyor.
Kullanım alanları
- Oyunlar: Video oyunları ve masa oyunları, iyi tanımlanmış kurallarıyla ideal eğitim ortamlarıdır.
- Fizik simülasyonları: Robotların yürüme ve kavrama becerilerini güvenle öğrenmesi.
- Otonom sürüş simülatörleri: Tehlikeli senaryoları gerçek yolda denemeden test etmek.
- Dil modeli ajanları: Kodlama, web ve masaüstü görevleri için sanal çalışma ortamları.
- Ekonomi ve lojistik simülasyonları: Fiyatlama, stok ve tedarik zinciri kararlarını denemek.
Ilgili terimler
