*Yukarıdaki butona tıkla ve ekle. Yapay zeka gelişmelerini Google’da her zaman üstte gör.

Yapay zekanın yeni katmanı karar modelleri: LLM'den farkı ne, Jev ve Clef nasıl çalışır, hangi iş için hangi model uygun? Fiyatlar, kalibrasyon ve destek talebine karar katmanı kurma senaryosu.
2026 Eylül'ünün sonunda yapay zekada ilginç bir şey oldu: bir grup model metin yazmayı bıraktı.
Birkaç gün içinde Cloudflare, Amazon, Perplexity, OpenAI, Databricks ve Fastino aynı türden ürünler duyurdu. Hepsi aynı işi yapıyordu: sana cümle kurmuyor, karar veriyordu. "Bu talep acil mi?" sorusuna paragraf değil, 0,94 gibi bir sayı dönüyordu. "Hangi ekibe gitsin?" sorusuna da açıklama değil, her seçeneğin ne kadar olası olduğunu gösteren bir liste geliyordu.
Bunlara karar modelii
metin üretmeyen, sorunun cevabını hazır seçenekler arasından olasılıkla veren yapay zeka modeli deniyor. Ekim başında topluluk dizinlerinde listelenen karar modeli sayısı 180'e ulaşmıştı. Senin açından asıl soru şu: bu modeller bir dil modelinin yerini mi alıyor, yoksa yanına mı ekleniyor?
Kısa cevap: yanına ekleniyor. Ama hangi işi devraldığını bilmezsen iki hatadan birine düşersin. Ya basit bir sınıflandırma için pahalı bir dil modeline para ödemeye devam edersin, ya da karar katmanını yanlış eşikle kurup işi bozarsın. Aşağıda ikisinden de nasıl kaçınacağını bulacaksın. Kategorinin büyük resimde nereye oturduğunu görmek istersen açık kaynak ile kapalı AI modelleri arasındaki tercih rehberimize de bakabilirsin, çünkü karar modelleri bu ayrımın tam ortasında duruyor.
Bir dil modelinden karar istemek, aslında ondan tasarlanmadığı bir işi yapmasını istemek demek.
Bunu bir örnekle düşün. Bir destek talebini modele verip "bu acil mi, cevabı JSON olarak döndür" diyorsun. Model sana cevabı kelime kelime yazıyor. Sonra sen o cevabı programının okuyabileceği hale getirmek için ayıklıyorsun (parsei
metni programın okuyabileceği yapıya çevirme). Model bazen {"urgent": true} yazıyor, bazen "Evet, bu talep acil görünüyor." diyor, bazen de JSON'u yarım bırakıyor ve kodun hata veriyor. Cevap süresi de değişiyor: bazen 200 milisaniyede dönüyor, bazen 3 saniye sürüyor, çünkü model her seferinde kelime kelime üretim yapıyor.
Karar modeli bu işi baştan farklı yapıyor. Ona iki şey veriyorsun:
Geri gelen şey serbest bir metin değil. Her sorunun her seçeneği için bir olasılık geliyor. Model cümle kurmuyor, sadece hangi seçeneğin ne kadar olası olduğunu hesaplıyor. Bu da üç şeyi değiştiriyor.
Ayıklama derdi bitiyor. Cevap zaten düzenli bir yapıda geldiği için kodun onu doğrudan okuyor. "Model bugün JSON'u bozuk döndürdü" diye bir hata türü ortadan kalkıyor.
Cevap süresi kısa ve tahmin edilebilir oluyor. Üretilecek kelime olmadığı için süre cevabın uzunluğuna bağlı değil. Şirketlerin açıkladığı değerler birkaç on milisaniye ile yarım saniye arasında değişiyor. Bu, çoğu dil modelinden daha hızlı.
Güveni ölçebiliyorsun. Model "acil" dediğinde yanında bir sayı da geliyor: 0,94. Bu sayı olmadan bir kararı otomatiğe bağlayamazsın. Sayı varsa bir eşik koyup "bunun üstündekileri otomatik işle" diyebilirsin.
Psikolog Daniel Kahneman iki düşünme biçimi tarif eder. System 1i
hızlı, sezgisel, çaba gerektirmeyen düşünme, kalabalıkta tanıdık bir yüzü bir bakışta fark etmen gibidir. System 2i
yavaş, adım adım, çaba isteyen düşünme ise 17 çarpı 24'ü kafadan hesaplamaya çalıştığında devreye girer.
Büyük dil modelleri System 2 gibi çalışır. Düşünme adımlarını tek tek yazarlar. Bu yüzden yavaş ve pahalıdırlar ama karmaşık işlerde iyidirler.
Kategoriyi başlatan şirket TypeSafe, model sınıfına adını buradan verdi: System One. Şirketin fikri şuydu: işletmelerin ihtiyaç duyduğu kararların çoğu aslında System 2 işi değil. "Bu talep iade mi, kargo mu, teknik mi?" sorusu uzun bir akıl yürütme gerektirmiyor. Tek seferde, güvenilir bir olasılıkla cevaplanabiliyor.
Yine de bu fikrin zayıf bir yanı var: zor vakalarda tek seferlik bakış yetmiyor. İkinci dalga tam bu boşluğu doldurmak için çıktı. Fastino'nun 30 Eylül'de yayınladığı GLiDE böyle çalışıyor. Model önce hızlı bir tahmin yapıyor. Kendinden eminse kararı hemen veriyor, emin değilse ek düşünme yapıyor. Yani hızlı düşünmeyi varsayılan, yavaş düşünmeyi yedek olarak kullanıyor.
Seçim yaparken bu fark doğrudan fiyata ve hıza yansıyor. Tek seferde karar veren modeller genelde daha hızlı. Gerektiğinde düşünen modeller zor vakalarda daha isabetli ama o vakalarda daha yavaş.
TypeSafe'in Jev ile getirdiği soru biçimi kısa sürede ortak dil haline geldi. Cloudflare'in modelleri bu biçimle birebir uyumlu çalışıyor. Databricks'in fonksiyonu da Jev ile uyumlu. Perplexity ve Ollama da aynı üç soru tipini kullanıyor:
noul: evet/hayır sorusu. Cevap olarak tek bir olasılık gelir. 0,94 geldiyse model talebin büyük ihtimalle acil olduğunu söylüyor.
choice: bir listeden seçim. Her seçeneğin olasılığını gösteren bir dağılım gelir. En yüksek olasılıklı seçenek modelin kararıdır, ama diğer seçeneklerin oranlarını da görürsün.
score: sıralı bir ölçekte puanlama. "Hasar ne kadar ciddi: yok / küçük / büyük / kritik" gibi. Cevap olasılıklara göre ağırlıklandırılmış bir puan olarak gelir.
Basitleştirilmiş bir istek şöyle görünüyor (alan adları sağlayıcıya göre küçük farklar gösterebilir):
{
"state": "Kartımdan iki kez para çekildi, ikisi de 14:32'de.",
"questions": {
"urgent": { "type": "noul", "instructions": "Bu talep acil mi?" },
"team": { "type": "choice", "instructions": "Hangi ekip ilgilenmeli?",
"criteria": { "billing": "Fatura, ödeme, iade",
"technical": "Kesinti, hata, yapılandırma",
"sales": "Plan ve yükseltme" } },
"impact": { "type": "score", "instructions": "Müşteri etkisi ne düzeyde?",
"criteria": ["Yok", "Küçük", "Büyük", "Kritik"] }
}
}
Dönen cevapta üç soru için üç ayrı sonuç var: urgent için tek bir sayı, team için üç seçeneğin oranları, impact için ağırlıklı bir puan. İçinde tek bir cümle yok. Bu isteği göndermek için bir API anahtarı ve tek bir çağrı yeterli. API kavramlarını tazelemek istersen yapay zeka API'si rehberimize bakabilirsin.
Bir karar modeli seçerken tek ölçün benchmark skoru olmamalı. Asıl bakman gereken şey kalibrasyoni
modelin söylediği güven oranıyla gerçekte ne kadar doğru çıktığının örtüşmesi.
Farkı bir örnekle görelim. Model 100 talep için "%94 eminim, acil" dediyse ve bunların 94'ü gerçekten acilse, model kalibre demektir. Ama model "%95 eminim" deyip 100 vakanın sadece 60'ında doğru çıkıyorsa, skoru yüksek olsa bile kalibrasyonu bozuktur. Böyle bir modelle otomatik karar veremezsin. "%90'ın üstündekiler otomatik geçsin" dediğin anda, aslında %60 doğrulukla çalışan bir kuyruğu otomatiğe bağlamış olursun.
Kalibrasyon iki ölçüyle takip edilir: ECEi
beklenen kalibrasyon hatası; sıfıra ne kadar yakınsa o kadar iyi ve Brier skorui
olasılık tahminlerinin ne kadar isabetli olduğunu gösteren ölçü; düşük olması iyi. İkisi de benchmark tablolarında nadiren görünür, çünkü şirketler genelde doğruluk yüzdesini yayınlamayı tercih eder.
Kalibrasyonu ölçebildiğinde işine yarayacak bir yöntem açılır: seçici otomasyon. Model emin olduğunda işlem otomatik yapılır. Emin olmadığında iş bir insana ya da bir dil modeline devredilir. Doğru eşiği bulduğunda taleplerin büyük kısmı otomatik akar, riskli olanlar ise insanın elinde kalır.
[mindi_yorum]
💰 Karar modelleri metin üretmediği için çıktıya para ödemiyorsun; girdi fiyatı da çoğu dil modelinin çok altında.
🟢 Tek çağrıda üç tip soruyu birlikte sorabiliyorsun: "acil mi", "hangi ekip" ve "ne kadar ciddi" cevabı aynı anda geliyor.
🟡 Yüksek skorlu ama kalibre olmayan bir modelle eşik koyamazsın; doğruluk yüzdesi tek başına yanıltır.
🔵 Benchmark tablolarının çoğunu modeli çıkaran şirket kendisi hazırlıyor, bu yüzden kendi verinle mutlaka çapraz test yap.
15 Eylül 2026'da San Francisco merkezli TypeSafe AI, Jev adında bir model yayınladı. Şirketin kurucusu Diogo Almeida, OpenAI'da InstructGPT ve RLHF çalışmalarının ortak yazarlarından biri. Şirket aynı gün DCVC liderliğinde 40 milyon dolarlık tohum yatırımı aldığını da duyurdu. Jev'in iddiası netti: metin üretmeyen, sadece karar veren bir model.
Üç hafta sonra decisioneval.dev dizini 180 karar modeli listeliyordu. 29 Eylül ile 1 Ekim arasında ise büyük şirketler arka arkaya ürün duyurdu.
Cloudflare, Workers AI üzerinden iki model çıkardı: Clef ve Clef-flash. İkisi de Apache-2.0 lisansıyla açık ağırlıklı olarak yayınlandı, yani modelleri indirip kendi sunucunda da çalıştırabiliyorsun. Clef, Qwen3.8-27B tabanlı 27 milyar parametreli bir model. Clef-flash ise Qwen3.5-9B tabanlı, 9 milyar parametreli hızlı sürüm. İkisinin de bağlam penceresi 65.536 token ve ikisi de metin, JSON ve istek başına en fazla dört görseli okuyabiliyor. Workers AI'da Clef'in milyon girdi token'ı başına fiyatı 0,24 dolar, Clef-flash'ınki 0,09 dolar. Çıktıya ücret alınmıyor.
Amazon, Strands ajan araçlarının yanına Strands Decider 2B'yi ekledi. Model Qwen3.5-2B tabanlı. Dil modelinin cevap yazan kısmı çıkarılmış, yerine yaklaşık 1 milyon parametrelik küçük bir seçim katmanı konmuş. Lisans Apache-2.0. Ağırlıklar, kod, eğitimde kullanılan veri listesi ve eğitim tarifi birlikte yayınlandı. Amazon'un açıkladığı ortanca cevap süresi bir RTX 3090 ekran kartında 115 milisaniye, ekran kartı olmadan bir Mac işlemcisinde ise 153 milisaniye. Yani GPU olmadan da iş görüyor.
Perplexity, Decisions API'yi duyurdu. Arkasındaki model pplx-decider-v1-27b, Qwen3.8-27B tabanlı ve Apache-2.0 lisanslı. Milyon girdi token'ı başına 0,04 dolar, çıktı ücretsiz. Tek çağrıda 1 ile 128 arasında soru sorabiliyorsun, girdi sınırı 262.144 token ve duruma görsel de ekleyebiliyorsun. Şirketin açıkladığı 11 testlik ortalama %85,71. Aynı testlerde Jev %84,51 alıyor.
OpenAI, 29 Eylül'deki DevDay etkinliğinde kendi Decisions API'sini tanıttı. Şimdilik sadece seçili müşterilere açık bir ön izleme ve fiyatı açıklanmadı. Databricks ise 30 Eylül'de ai_decide adında bir fonksiyon çıkardı. Bu fonksiyon SQL içinden karar sorusu sormayı sağlıyor ve Jev ile uyumlu, ama şimdilik beta aşamasında ve fiyatı yayınlanmadı. Bu iki ürün için resmi fiyat açıklanana kadar maliyet planı yapma.
TypeSafe'in Jev'i hâlâ referans noktası. Milyon girdi token'ı başına 0,042 dolar, çıktı ücretsiz. Durum ve en uzun soru için 32.000 token yer ayrılıyor. Şirketin açıkladığı cevap süresi 70 ile 500 milisaniye arasında. Modelin teknik bilgileri Jev model sayfasında, nasıl kullanıldığı ise Jev araç sayfasında var.
Fastino Labs'ın GLiDE'i, gerektiğinde düşünebilen ilk karar modeli olarak çıktı. 40.000 token bağlamla çalışıyor ve şimdilik sadece Fastino'nun API'si üzerinden kullanılabiliyor. Fiyatı farklı kaynaklarda tutarsız göründüğü için burada rakam vermiyoruz. Aynı laboratuvarın GLiNER2.5-Decide modeli ise tam tersi bir yerde duruyor: 340 milyon parametreli, Apache-2.0 lisanslı, açık ağırlıklı bir model ve ekran kartı olmadan, sadece işlemciyle çalışabiliyor.
En hareketli taraf burası. Laya, Convai Innovations tarafından Apache-2.0 lisansıyla yayınlandı. İngilizce sürümü 421 milyon, çok dilli sürümü 322 milyon parametreli. Stanford'un laboratuvarlarından çıkan ve NVIDIA ile birlikte duyurulan CLM-8B ise farklı bir yol izliyor: Qwen3-8B modeli olduğu gibi bırakılıyor, üzerine 20'şer milyon parametrelik iki küçük katman ekleniyor. Ekip, modelin bazı ajan görevlerinde Jev'e yakın doğrulukla ve dokuz kata kadar daha hızlı çalıştığını söylüyor. Lisansı Apache-2.0.
Bu dalgadan başka isimler de var: Jared Palmer'ın Kev ailesi, 144 milyon parametrelik Julia-1, 4 milyar parametrelik lev ve AutoTrust'ın JEV-9B'si bunlardan birkaçı. Bespoke Labs'ın 9 milyar parametreli nimble'ı ile Together AI'ın tev1 (4 milyar) ve tev1:0.8b modelleri de bu listede.
Burada bir uyarı gerekiyor. "OpenJev" adını taşıyan iki ayrı proje var. Zefan Cai'nin Open-Jev-27B'si güçlü bir model ama CC BY-NC 4.0 lisansıyla yayınlandı, yani ticari kullanımı yasak. Theo Lee'nin 4 milyar parametreli OpenJev'i ise MIT lisanslı. Açık ağırlıklı olmak, ticari kullanıma açık olmak demek değil. Lisansı her modelde ayrıca oku.
Altyapı da hızla oturdu. Ollama 29 Eylül'de, llama.cpp 2 Ekim'de karar modelleri için /v1/systemone ucunu ekledi. OpenRouter da Jev'i normal sohbet ucundan ayrı bir karar ucu üzerinden sunuyor. Yani bu modelleri artık hem bulut API'sinden hem de kendi bilgisayarından çağırabiliyorsun.
Aşağıdaki rakamlar Ekim 2026 başındaki durumu gösteriyor. Cevap süreleri şirketlerin kendi ölçümleri.
| Model | Lisans | Girdi fiyatı (1 milyon token) | Cevap süresi | Bağlam |
|---|---|---|---|---|
| pplx-decider-v1-27b | Apache-2.0 | 0,04 $ | Kısa girdide 2 sn altı | 262.144 |
| Jev | Kapalı | 0,042 $ | 70–500 ms | 32.000 |
| Clef-flash | Apache-2.0 | 0,09 $ | 38,8 ms | 65.536 |
| Clef | Apache-2.0 | 0,24 $ | 209,3 ms | 65.536 |
| GLiDE | Kapalı | Net değil | Açıklanmadı | 40.000 |
| GLiNER2.5-Decide | Apache-2.0 | Kendi sunucunda | 167 ms (işlemcide) | — |
| Strands Decider 2B | Apache-2.0 | Kendi sunucunda | 115 ms (GPU), 153 ms (işlemci) | — |
| CLM-8B | Apache-2.0 | Kendi sunucunda | — | — |
Tablonun gösteremediği bir şey var: şirketlerin kendi ölçümleri ile bağımsız ölçümler farklı çıkabiliyor. Bağımsız bir karşılaştırmada Clef-flash'ın cevap süresi 191–205 milisaniye, Jev'inki yaklaşık 524 milisaniye ölçüldü. Yani tablodaki süreleri kesin değil, kabaca bir sıralama olarak oku.
Başarı sıralamaları da ölçümü kimin yaptığına göre değişiyor. Cloudflare'in kendi BANKING77 testinde Clef %94,20 alırken Jev %79,74'te kalıyor. Fastino kendi testinde GLiDE'e 64,81, Jev'e 57,91 puan veriyor. Perplexity'nin testinde de kendi modeli önde. Kısacası hangi tabloya bakarsan, o tabloyu yayınlayan şirketin modeli kazanıyor.
Buradan çıkacak sonuç basit: hiçbir tabloya tek başına güvenme. Kendi verinden 200 örnek ayır, iki üç modeli aynı sorularla dene ve kalibrasyonlarına bak.
Bu bölümde sıfırdan başlayıp bir karar modeline ilk sorunu soracaksın. Örnek senaryo şu: küçük bir online mağazan var ve müşterilerden mesaj geliyor. Her mesajı okuyup "bu hangi ekibin işi, müşteri iade istiyor mu, ne kadar acil" diye ayırmak vakit alıyor. Bu işi bir karar modeline yaptıracağız.
Başlamadan önce bilmen gerekenler:
Ollama, yapay zeka modellerini kendi bilgisayarında çalıştırmanı sağlayan ücretsiz bir program. ollama.com/download adresinden bilgisayarına uygun sürümü indir ve normal bir program gibi kur.
Kurulum bitince sürümünü kontrol et. Windows'ta Başlat menüsüne "PowerShell" yazıp aç, Mac'te Terminal'i aç ve şunu yaz:
ollama -v
Çıkan numara 0.35.0 ya da daha yüksek olmalı. Karar modelleri bu sürümle geldi. Daha eski bir numara görürsen Ollama'yı aynı adresten yeniden indirip kur.
Aynı pencereye şunu yaz:
ollama pull tev1:0.8b
Bu, Together AI'ın yaklaşık 800 MB'lık küçük karar modeli. Çoğu dizüstü bilgisayarda rahat çalışır. Bilgisayarın güçlüyse daha isabetli olan nimble modelini de deneyebilirsin (ollama pull nimble), ama o yaklaşık 9,5 GB.
Karar modeline serbest soru sormuyorsun. Soruyu ve olası cevapları sen belirliyorsun. Örnek müşteri mesajımız şu olsun:
"Kartımdan iki kez para çekildi, fazla ödemeyi iade edin lütfen."
Bu mesaj için üç soru soracağız:
Masaüstünde yeni bir metin dosyası aç. Windows'ta Not Defteri'ni, Mac'te TextEdit'i kullanabilirsin (TextEdit'te önce Biçim menüsünden "Düz Metin Yap"ı seç). Aşağıdaki metni olduğu gibi yapıştır:
{
"model": "tev1:0.8b",
"state": { "mesaj": "Kartımdan iki kez para çekildi, fazla ödemeyi iade edin lütfen." },
"questions": {
"ekip": {
"type": "choice",
"instructions": "Bu mesajla hangi ekip ilgilenmeli?",
"criteria": {
"odeme": "Ödeme, fatura ve iade",
"teknik": "Site hatası, giriş sorunu",
"diger": "Bunların hiçbiri"
}
},
"iade": {
"type": "noul",
"instructions": "Müşteri açıkça iade istiyor mu?"
},
"aciliyet": {
"type": "score",
"instructions": "Bu mesaj ne kadar acil?",
"criteria": ["Normal", "Yakında", "Acil"]
}
}
}
Dosyayı masaüstüne istek.json adıyla kaydet. Not Defteri'nde kaydederken "Kayıt türü" kutusunda "Tüm dosyalar"ı seç, yoksa dosyanın sonuna .txt eklenir.
Dosyada değiştirebileceğin yerler tırnak içindeki Türkçe metinler: müşteri mesajı, soruların metni ve seçeneklerin açıklamaları. model, state, questions, type, instructions ve criteria gibi İngilizce kelimelere dokunma, model soruyu bu kelimelerden anlıyor.
PowerShell ya da Terminal penceresinde önce masaüstüne geç:
cd Desktop
Sonra soruyu gönder. Windows'ta:
curl.exe http://localhost:11434/v1/systemone -H "Content-Type: application/json" -d "@istek.json"
Mac'te:
curl http://localhost:11434/v1/systemone -H "Content-Type: application/json" -d @istek.json
"Bağlantı kurulamadı" gibi bir hata alırsan Ollama arka planda çalışmıyor demektir. Ollama programını bir kez açıp komutu tekrar dene.
Birkaç saniye içinde ekrana şuna benzer bir cevap gelir. Rakamlar senin denemende farklı çıkacak, bu sadece örnek:
{
"answers": {
"ekip": {
"type": "choice",
"choice": "odeme",
"probabilities": { "odeme": 0.985, "teknik": 0.012, "diger": 0.003 },
"confidence": 0.922
},
"iade": { "type": "noul", "noul": 0.997 },
"aciliyet": {
"type": "score",
"score": 0.815,
"probabilities": { "0": 0.378, "1": 0.429, "2": 0.193 },
"confidence": 0.046
}
}
}
Bu cevabı şöyle okuyorsun:
confidence (güven) 0,92 ile yüksek, yani model bu kararda emin.Burada önemli bir ayrıntı var: güven değeri cevabın doğru olduğunu garanti etmez. Sadece modelin olasılıkları ne kadar tek bir seçenekte topladığını gösterir. Modelin güvenine ne kadar inanabileceğini bir sonraki adımda kendin ölçeceksin.
Şimdi istek.json dosyasındaki müşteri mesajını değiştir ve komutu tekrar gönder. Gerçek gelen kutundan 10-20 farklı mesaj dene: kargo gecikmesi, şifre sıfırlama, ürün sorusu, kızgın bir şikâyet.
Her denemede küçük bir tablo tut: mesaj, modelin kararı, modelin güveni ve senin doğru bulduğun cevap. 20 denemenin sonunda şunu göreceksin: model yüksek güvenle karar verdiğinde ne sıklıkla haklı, düşük güvende ne sıklıkla yanılıyor. Bu, rehberin başında anlatılan kalibrasyonun ta kendisi.
Küçük model Türkçe mesajlarda sık yanılıyorsa önce nimble modelini dene (istek dosyasındaki "model" satırını değiştirmen yeterli). O da yetmezse bir sonraki adımda bulut modellerine geçebilirsin.
Denemelerin sonunda basit bir kural çıkacak. Örneğin: "güven 0,8'in üstündeyse mesajı otomatik olarak ilgili ekibe yönlendir, altındaysa ben bakayım." Bu kural sayesinde işin büyük kısmı kendiliğinden akar, emin olunmayan mesajlar sende kalır.
Bunu her gün elle yapmak yerine otomatikleştirmek istersen n8n gibi bir otomasyon aracı kullanabilirsin. Akış kabaca şöyle kurulur: yeni e-posta gelir, aynı soru "HTTP Request" adımıyla karar modeline gönderilir, cevaptaki ekibe ve güvene göre mesaj doğru klasöre ya da kişiye yönlendirilir. Bu adımda karar modeli sadece ayırma işini yapıyor. Müşteriye cevap yazmak gerekiyorsa o işi yine bir dil modeline ya da kendine bırakırsın.
Bilgisayarın sürekli açık kalmayacaksa ya da mesaj sayısı çok yüksekse modeli bulut üzerinden çağırmak daha pratik olur. Jev, Clef ve pplx-decider aynı soru biçimini kullandığı için istek.json'daki soruların neredeyse aynen işe yarar. Sadece adres ve API anahtarı değişir.
Diyelim mağazana günde 1.400 mesaj geliyor ve her mesaj ortalama 600 token tutuyor. Bu, ayda yaklaşık 25,2 milyon token eder. Bu hacimde bulut modellerinin aylık girdi maliyeti şöyle:
| Model | Aylık maliyet |
|---|---|
| pplx-decider-v1-27b | 1,01 $ |
| Jev | 1,06 $ |
| Clef-flash | 2,27 $ |
| Clef | 6,05 $ |
Bu rakamlar sadece girdi tarafını gösteriyor ve senin mesaj sayına göre değişir. Yine de ölçek hakkında fikir veriyor: mesajları ayırma işi ayda birkaç dolarlık bir maliyet. Asıl masraf, cevapları yazdırıyorsan, cevabı yazan dil modelinde.
Ajanın adımlarını kontrol etmek. Bir AI ajanına "şu e-postayı sil" yetkisi vermeden önce, silme komutunun gerçekten kullanıcının onayladığı işle eşleşip eşleşmediğini karar modeline sorabilirsin. Güven düşükse işlem durur. Bu, prompt injection saldırılarına karşı en pratik koruma katmanlarından biri. Konunun tamamı prompt injection rehberinde var. Ajan kurmaya yeni başlıyorsan en iyi AI ajan araçları listesi iyi bir başlangıç noktası.
Başvuru ve belge ön elemesi. İşe alım, kredi ya da burs gibi çok başvuru gelen alanlarda aynı üç soru tipiyle tekrarlanabilir bir ön eleme katmanı kurulabilir. Kararın gerekçesini de yazman gerekiyorsa, dil modelini karar modelinin arkasına ekle. İnsanlar hakkındaki kararlarda son sözün yine bir insanda olması gerektiğini de unutma.
İçerik denetimi. Yorum, mesaj ve ilan akışında "kural ihlali var mı" sorusunu noul tipiyle, "hangi kural ihlal edildi" sorusunu choice tipiyle sorarsın. İki cevabı tek çağrıda alırsın.
Verinin dışarı çıkmasını istemiyorsan ya da çok yüksek hacimde çalışıyorsan, açık ağırlıklı modelleri kendi bilgisayarında çalıştırabilirsin.
Yol şu: modeli Hugging Face'ten indiriyorsun, yerel bir sunucuyla çalıştırıyorsun ve /v1/systemone ucundan çağırıyorsun. Bu destek 29 Eylül'de Ollama 0.35 sürümüyle geldi. llama.cpp'ye ise 2 Ekim'de eklendi ve Julia-1, Laya, Kev-4B, lev ve OpenJev modellerini kapsıyor.
Ollama ile ilk denemeyi yukarıdaki adımlarda yaptın. Ollama'nın hazır sunduğu üç karar modeli var: nimble (Bespoke Labs, 9 milyar parametre), tev1 (Together AI, 4 milyar) ve tev1:0.8b.
Bir şeye dikkat et: karar ucu normal sohbet ucundan farklı. İndirdiğin modelin gerçekten karar modeli olarak eğitilmiş olması gerekiyor. Sıradan bir sohbet modeli bu uçtan düzgün cevap vermez. İndirmeden önce model kartındaki açıklamaya bak.
Karar modellerinin çoğu küçük olduğu için donanım tarafı da genelde sorun çıkarmıyor. llama.cpp ekibinin güçlü bir iş istasyonu ekran kartında (RTX PRO 6000) yaptığı ölçümlerde Julia-1 (144 milyon parametre) 3 milisaniyede, Laya (421 milyon) 5 milisaniyede, Kev-4B 12 milisaniyede, 27 milyar parametreli OpenJev ise 43 milisaniyede cevap veriyor. Senin bilgisayarında bu süreler daha uzun olur. Küçük modeller ekran kartı olmadan da çalışabiliyor. 27 milyar parametreli modeller için ise güçlü bir ekran kartı ya da küçültülmüş (quantizei
modelin dosya boyutunu ve bellek ihtiyacını azaltma) bir sürüm gerekir.
Her yerel çalıştırma aracı bu soru biçimini desteklemiyor. Şimdilik Ollama ve llama.cpp destekliyor. Başka bir araç kullanıyorsan önce karar ucunu sunup sunmadığına bak.
[mindi_yorum]
💰 Kendi bilgisayarında çalıştırınca token başına ücret yok; Strands Decider 2B ekran kartı olmadan, bir Mac işlemcisinde 153 milisaniyede cevap veriyor.
🟢 Yerel destek çok hızlı geldi: Ollama 29 Eylül'de, llama.cpp 2 Ekim'de karar modellerini çalıştırmaya başladı.
🟡 Açık ağırlık, ticari kullanım izni demek değil: Open-Jev-27B CC BY-NC 4.0 lisanslı ve ticari kullanımı yasak.
🔵 Türkçe metinle çalışacaksan model seçmeden önce aşağıdaki Türkçe sonuçlara bak.
Türkçe tarafında elimizde artık somut bir ölçüm var. Ekim başında ufak AI ekibi HakemBench adında Türkçe bir karar testi yayınladı. Test 4.275 sorudan oluşuyor ve 16 model üzerinde denendi. Öne çıkan sonuçlar şöyle:
| Model | Sıra | Puan |
|---|---|---|
| Gemini 3.8 Flash | 1. | 0,888 |
| Jev 1.13 | 4. | 0,825 |
| ufakzeka-karar | 7. | 0,660 |
| Laya | 15. | 0,081 |
Bu tablodan iki sonuç çıkıyor. Birincisi, Türkçe metinde genel amaçlı büyük modeller hâlâ önde. Jev ise dördüncü sırada ve fena bir sonuç almıyor. İkincisi, İngilizce testlerde iyi görünen her açık model Türkçede aynı başarıyı göstermiyor. Laya bunun en net örneği.
Listedeki ufakzeka-karar, 182 milyon parametreli ve Apache-2.0 lisanslı bir Türkçe karar modeli. Ekran kartı olmadan, Apple M1 işlemcinin tek çekirdeğinde soru başına ortanca 102,5 milisaniyede cevap veriyor. Genel puanı Jev'in altında ama maliyeti ve hızı bambaşka bir seviyede. Türkçe ve dar tanımlı bir iş için yeterli olabilir. Ekibin kendi yaptığı bir uyarı da var: modelin "emin değilim" sinyali, prompt injection hatalarını yakalamak için güvenilir değil.
Testin de bir sınırı var: soruların doğru cevaplarının çoğu yapay zeka modelleriyle üretilmiş ve insanlar tarafından tek tek kontrol edilmemiş. Bu yüzden HakemBench'i başlangıç noktası olarak kullan. Sonra kendi verinden 200 örnek ayırıp iki üç modeli yan yana dene.
Karar modeli fikrini ilk elden görmek için en doğrudan adres. Jev'in mindilot sayfasında ne yaptığını ve nasıl çağrıldığını bulabilirsin. Fiyatı en düşüklerden biri, soru biçimi diğer modellerin de kullandığı ortak dil haline geldi ve dokümantasyonu en olgun olanı. Türkçe testte de dördüncü sırada. Zayıf yanı, modelin bulutta çalışması ve indirilebilir bir sürümünün olmaması.
Zaten bir OpenRouter hesabın varsa Jev'i ayrı bir hesap açmadan deneyebilirsin. OpenRouter, Jev'i normal sohbet ucundan ayrı, deneme aşamasındaki bir karar ucu üzerinden sunuyor. Dikkat etmen gereken nokta şu: bu uç alışık olduğun sohbet ucuna benzemiyor, istek ve cevabın biçimi farklı. Kullandığın hazır kütüphaneler doğrudan çalışmayabilir.
Açık modelleri indirme rehberimizde anlatılan akış burada da geçerli. Clef, Clef-flash, CLM-8B, Laya, Kev, Strands Decider ve ufakzeka-karar indirilebilir durumda. Karar modelleri genelde küçük olduğu için indirmek ve ilk kez çalıştırmak, büyük dil modellerine göre çok daha hızlı.
Bu rehberde geçen modellerden üçünün ayrıntılı sayfası mindilot'ta var: Jev, Clef ve pplx-decider-v1-27b. Fiyat, bağlam penceresi ve güçlü-zayıf yanlarını orada yan yana görebilirsin.
Kısaca hangi durumda neye bakacağın:
tev1:0.8b.Kategori daha üç haftalık ve bu da beraberinde bazı tuzaklar getiriyor.
Benchmark tablolarını çoğunlukla şirketler kendisi hazırlıyor. Yukarıda gördüğün gibi her tabloda farklı bir model birinci. Kullanmaya başlamadan önce kendi verinle dene.
Yüksek skor, iyi kalibrasyon demek değil. Doğruluk yüzdesi yüksek bir model, güvenilir bir eşik koymana izin vermeyebilir.
Açık ağırlıklı model, serbest ticari kullanım demek değil. Lisansı her modelde ayrıca oku. Open-Jev-27B bunun somut örneği.
Fiyatlar sık değişiyor. Bu rehberdeki rakamlar Ekim 2026 başına ait. Karar vermeden önce sağlayıcının kendi fiyat sayfasına bak. OpenAI ve Databricks henüz fiyat açıklamadı.
Karar modeli dil modelinin yerini almıyor. Sınıflandırma, yönlendirme ve güvenlik kontrolü gibi dar işleri devralıyor. Cümle kurmak hâlâ dil modelinin işi. İkisini birlikte kurduğunda maliyet düşüyor, tutarlılık artıyor.
Türkçe sonuçlar modelden modele çok değişiyor. İngilizce testlerde iyi olan bir model Türkçede çok geride kalabiliyor. Bunu bir engel değil, plan yaparken hesaba katman gereken bir bilgi olarak gör.
Yeni model türleri birbirine karışabiliyor. Karar modelleri, dünya modelleri ve akıl yürütme modelleri "yeni tür model" başlığı altında anılıyor ama yaptıkları işler tamamen farklı. Karar modeli bir dünya simülasyonu kurmuyor, sadece sorduğun soruyu olasılığa çeviriyor. Farkı görmek istersen world model rehberimize bakabilirsin.