Geri Bildirim Döngüsü (Feedback Loop)
Araç kavramlarıGeri Bildirim Döngüsü nedir?
Makine öğrenmesinde geri bildirim döngüsü (feedback loop), bir modelin verdiği kararların, o modelin ya da başka bir modelin sonraki eğitim verisini etkilemesi durumudur. Model dünyayı gözlemlemekle kalmaz, dünyayı değiştirir; sonra bu değişmiş dünyadan yeniden öğrenir.
Basit bir örnek: Bir video platformu kullanıcılara en çok tıklanan videoları öneriyor. Önerilen videolar daha çok izleniyor, daha çok izlenen videolar bir sonraki eğitimde daha "popüler" görünüyor ve daha da çok öneriliyor. Sonunda sistem küçük bir içerik havuzuna kilitleniyor.
Nasıl çalışır?
Döngü genellikle şu adımlarla oluşur: model bir tahmin yapar, bu tahmin kullanıcıya bir şey gösterir veya bir karar verir, kullanıcı davranışı bu karara göre şekillenir, yeni davranış verisi toplanır ve model bu veriyle yeniden eğitilir. Model, kendi kararlarının sonuçlarını "doğal gerçeklik" sanır.
Döngüler iki şekilde zarar verebilir. Birincisi önyargının büyümesidir: bir bölgede daha fazla devriye öneren bir suç tahmin modeli, o bölgede daha fazla suç kaydı üretir ve bu kayıtlar modeli daha da emin hale getirir. İkincisi keşif kaybıdır: model hiç göstermediği seçeneklerden veri toplayamaz, bu yüzden onların gerçekte ne kadar iyi olduğunu asla öğrenemez.
Bir de modeller arası döngüler var. Bir fiyatlama modelinin kararları, talep tahmin modelinin gördüğü veriyi değiştirir. İki model birbirini fark etmeden etkiler.
Neden önemli?
Geri bildirim döngüleri sessizdir. Model metrikleri iyi görünürken sistem yavaş yavaş dar, yanlı ve kırılgan hale gelebilir. Üretken yapay zeka döneminde bu konu yeni bir boyut kazandı: internete giderek daha çok yapay zeka üretimi içerik karışıyor ve gelecekteki modeller bu içerikle eğitiliyor. Model collapse tartışması da tam olarak bu döngünün bir türüdür.
Kullanım alanları
- Öneri sistemleri: Keşif oranı ekleyerek popülerlik döngüsünü kırmak.
- Kredi ve işe alım modelleri: Reddedilen başvuruların sonucunu hiç görmemenin yarattığı körlüğü yönetmek.
- Arama ve sıralama: Pozisyon yanlılığını düzeltmek; üstteki sonuç sırf üstte olduğu için tıklanır.
- LLM eğitimi: Sentetik veriyi insan verisiyle dengelemek.
- MLOps izleme: Veri dağılımı değişimlerini takip edip döngüyü erken fark etmek, gerekirse bir kontrol grubunu model kararlarından bağımsız tutmak.
Ilgili terimler
