⚡ Öne ÇıkanYapay zekaya sıfırdan başla. Ücretsiz Eğitimler

LLM Hakem (LLM-as-a-Judge)

Araç kavramları
Ing: LLM-as-a-JudgeGuncellendi: 20 Temmuz 2026
Bir dil modelinin çıktısını başka bir dil modeline puanlatma yöntemi. İnsan değerlendirmesi pahalı ve yavaş olduğu için ölçekli test bu şekilde yapılıyor.

LLM-as-a-Judge nedir?

Bir modelin ürettiği cevabın iyi mi kötü mü olduğunu ölçmek gerekir. Klasik yöntem insan değerlendiriciye sormaktır: iki cevabı yan yana koy, hangisi daha iyi diye sor. Bu doğru sonuç verir ama yavaştır ve pahalıdır — binlerce örneği tek tek okutmak haftalar sürer.

LLM-as-a-Judge, bu işi bir başka dil modeline devretmektir. Hakem role verilen modele "şu soru soruldu, şu iki cevap geldi, hangisi daha iyi ve neden" diye sorulur; model bir puan ya da tercih üretir. Zheng ve arkadaşlarının MT-Bench çalışması, güçlü bir hakem modelin insan tercihleriyle %80'in üzerinde uyum yakaladığını gösterdi — yani insanlar arasındaki uyuma yakın bir seviye.

Nasıl çalışır?

Üç yaygın kurulum var:

Tek cevap puanlama: Hakeme tek bir çıktı verilir, belirlenen ölçütlere (doğruluk, açıklık, formata uyum) göre 1–10 arası puan istenir.

İkili karşılaştırma: İki cevap yan yana verilir, hangisinin daha iyi olduğu sorulur. Sıralamalar bu karşılaştırmalardan çıkarılır.

Referanslı puanlama: Doğru cevap da hakeme verilir, model çıktısı bu referansa göre değerlendirilir. Matematik ve kod gibi kesin cevabı olan alanlarda daha güvenilirdir.

Hakem prompt'una genelde detaylı bir puanlama kılavuzu (rubric) eklenir. Yapılandırılmış çıktı istenerek puan ve gerekçe ayrı ayrı alınır.

Neden önemli?

Model geliştirmenin her aşamasında ölçüm gerekir: yeni bir prompt eski prompt'tan iyi mi, fine-tuning işe yaradı mı, sürüm güncellemesi bir şeyi bozdu mu. İnsan değerlendirmesiyle bu döngü günler sürer, LLM hakemle dakikalar. Regresyon testi mantığını dil modellerine taşıyan şey budur.

Ama bilinen sapmaları var. Hakem modeller uzun cevapları haksız yere daha iyi bulma (verbosity bias), listedeki ilk cevabı seçme (position bias) ve kendi ürettiği metni kayırma (self-enhancement bias) eğilimindedir. Bunlar sırayı rastgeleleştirerek, iki yönlü karşılaştırma yaparak ve hakem ile test edilen modeli farklı tutarak azaltılır — tamamen ortadan kalkmaz.

Kullanım alanları

  • Prompt varyantlarını A/B karşılaştırma
  • RAG hattında hangi retrieval ayarının daha iyi cevap ürettiğini ölçme
  • Fine-tuning öncesi ve sonrası çıktı kalitesini kıyaslama
  • Üretim ortamında örneklenmiş cevaplarda kalite takibi
  • Eğitim verisi filtreleme: düşük puanlı sentetik örnekleri eleme
mindi
mindi'nin notu
Hakem modeli test ettiğin modelle aynı seçme. Kendi cevabını okuyup "evet bu gayet iyi" diyen bir jüriye benziyor — teknik adı self-enhancement bias, pratikte tanıdık bir durum.