Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Yörünge (Trajectory)

Araç kavramları
Ing: TrajectorySon güncelleme: 25 Eylül 2026
Ajanın bir süre boyunca geçtiği durumlar, seçtiği eylemler ve aldığı ödüllerin sıralı kaydı. Ajanın ayak izleri.

Yörünge nedir?

Pekiştirmeli öğrenmede yörünge (trajectory), ajanın ortamla etkileşimi sırasında ortaya çıkan durum, eylem ve ödül dizisidir. Ajanın bir yolculuk boyunca bıraktığı ayak izlerinin eksiksiz kaydı gibi düşünülebilir: Hangi durumdaydı, ne yaptı, ne kazandı, sonra nereye vardı ve bu böyle devam etti.

Bir yörünge bir bölümün tamamını kapsayabilir ya da sadece belirli bir parçasını içerebilir. Literatürde bazen "rollout" terimi de benzer anlamda kullanılır.

Nasıl çalışır?

Bir yörünge şu şekilde temsil edilir: ilk durum, ilk eylem, ilk ödül, ikinci durum, ikinci eylem, ikinci ödül ve bu şekilde devam eder. Bu kayıt birçok farklı amaçla kullanılır:

  • Getiri hesaplama: Yörünge boyunca toplanan (genellikle indirimli) ödüllerin toplamı, o yörüngenin ne kadar başarılı olduğunu gösterir.
  • Politika güncelleme: Policy gradient yöntemleri, yüksek getirili yörüngelerdeki eylemlerin olasılığını artırır, düşük getirili yörüngelerdekileri azaltır.
  • Kredi atama: Yörünge incelenerek, sonuca en çok hangi eylemlerin katkı yaptığı anlaşılmaya çalışılır. Uzun yörüngelerde bu, pekiştirmeli öğrenmenin en zor problemlerinden biridir.

Yörüngeler sadece ajanın kendisi tarafından üretilmek zorunda değildir. İnsan uzmanların yörüngeleri de toplanabilir. İmitasyon öğrenmesi (imitation learning), ajanın bu uzman yörüngelerini taklit ederek öğrenmesine dayanır. Offline pekiştirmeli öğrenme ise önceden toplanmış yörüngelerden, ortamla yeni etkileşime girmeden öğrenmeye çalışır.

Neden önemli?

Yörünge, pekiştirmeli öğrenmenin ham verisidir. Ajanın ne öğrendiği, hangi yörüngeleri gördüğüne bağlıdır. Dil modeli ajanları bağlamında da bu kavram giderek daha sık kullanılıyor: Bir ajanın bir görevi çözerken attığı tüm adımlar, çağırdığı araçlar, aldığı sonuçlar ve verdiği ara kararlar bir yörünge oluşturur. Bu yörüngeler hem hataları ayıklamak hem de ajanları daha iyi eğitmek için değerli bir kaynaktır.

Başarılı yörüngeleri seçip bunlarla modeli yeniden eğitmek (bir tür kendi başarısından öğrenme), akıl yürütme modellerinin geliştirilmesinde de kullanılan bir yaklaşımdır.

Kullanım alanları

  • Policy gradient eğitimi: Yörüngelerden getiri hesaplayıp politikayı güncellemek.
  • İmitasyon öğrenmesi: İnsan sürücülerin ya da operatörlerin yörüngelerini taklit etmek.
  • Offline pekiştirmeli öğrenme: Log kayıtlarındaki geçmiş yörüngelerden öğrenmek.
  • Ajan hata ayıklama: Bir dil modeli ajanının adım adım kararlarını incelemek.
  • Robotik: Hareket planlamasında izlenecek yolu tanımlamak.
mindi
mindi'nin notu
Bir yapay zeka ajanının neden garip bir sonuca vardığını anlamak istiyorsan, yörüngesine bak. Cevap genellikle son adımda değil, çok daha önce atılan küçük bir yanlış adımda.