Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Derin Q-Ağı (Deep Q-Network)

Araç kavramları
Ing: Deep Q-Network (DQN)Son güncelleme: 25 Eylül 2026
Q-learning'i derin sinir ağlarıyla birleştirip ham piksellerden oyun oynamayı öğrenen dönüm noktası algoritma.

Derin Q-Ağı nedir?

Derin Q-ağı (Deep Q-Network, kısaca DQN), klasik Q-learning algoritmasını derin sinir ağlarıyla birleştiren bir pekiştirmeli öğrenme yöntemidir. 2013'te ön çalışma olarak, 2015'te ise geliştirilmiş haliyle yayımlanan araştırmada, aynı algoritma ve aynı ayarlarla onlarca farklı Atari oyununu sadece ekran piksellerine ve skora bakarak oynamayı öğrendi. Birçok oyunda insan seviyesine ulaştı ya da onu geçti.

Bu sonuç, derin öğrenme ile pekiştirmeli öğrenmenin birleşiminin, yani derin pekiştirmeli öğrenmenin, ciddi problemleri çözebileceğini gösteren ilk büyük kanıtlardan biri oldu.

Nasıl çalışır?

Klasik Q-learning her durum-eylem çifti için bir değeri tabloda saklar. Ama bir oyun ekranında olası durum sayısı astronomiktir; tablo tutmak imkânsızdır. DQN, bu tablonun yerine bir sinir ağı koyar: Ağ, ekran görüntüsünü girdi olarak alır ve her olası eylem için bir Q-değeri (o eylemin beklenen uzun vadeli ödülü) tahmin eder. Ajan en yüksek Q-değerli eylemi seçer.

Sinir ağlarıyla pekiştirmeli öğrenmeyi birleştirmek önceden kararsızlık sorunları yaşatıyordu. DQN bu sorunu iki kilit fikirle çözdü:

  • Deneyim tekrarı (experience replay): Deneyimler bir hafızada saklanır ve eğitimde rastgele örneklenir. Bu, ardışık karelerin birbirine bağımlılığını kırar.
  • Hedef ağ (target network): Bellman denklemindeki hedef değeri hesaplamak için ana ağın periyodik olarak güncellenen, dondurulmuş bir kopyası kullanılır. Böylece model sürekli hareket eden bir hedefi kovalamaz.

Keşif için epsilon-greedy stratejisi, görüntüleri işlemek için convolutional katmanlar kullanıldı.

Sonraki yıllarda DQN'in pek çok geliştirilmiş versiyonu çıktı: Q-değerlerinin aşırı iyimser tahminini düzelten Double DQN, durum değeri ile eylem avantajını ayıran Dueling DQN ve öncelikli deneyim tekrarı bunların başında gelir.

Neden önemli?

DQN, genel amaçlı öğrenme sistemleri fikrini somutlaştırdı: Her oyun için özel kural yazmadan, tek bir algoritmanın farklı görevleri kendi başına öğrenebileceğini gösterdi. Bu çalışma derin pekiştirmeli öğrenmeye yönelik ilgiyi patlattı ve sonraki yıllarda masa oyunlarında ve robotikte elde edilen başarıların önünü açtı.

Kullanım alanları

  • Oyun ajanları: Ayrık eylem uzayına sahip video oyunları.
  • Araştırma ve eğitim: Derin pekiştirmeli öğrenmenin temel referans algoritması.
  • Kaynak yönetimi: Ayrık kararlar içeren zamanlama ve tahsis problemleri.
  • Öneri sistemleri: Uzun vadeli kullanıcı memnuniyetini hedefleyen sıralı öneriler.
  • Ağ ve trafik kontrolü: Trafik ışığı zamanlaması gibi ayrık kontrol problemleri.
mindi
mindi'nin notu
DQN'in asıl mesajı "bir oyunu kazandı" değil, "hiç kural yazılmadan, aynı algoritma onlarca oyunu öğrendi" idi. Genel amaçlı öğrenme fikrinin ilk büyük vitrini.