DeepSeek V4.1 Flash
DeepSeek
Son güncelleme: 12 Eylül 2026
🖥️ Bu model bilgisayarında çalışır mı?
Ağırlıkları açık — donanımın yetiyorsa kendi bilgisayarında çalıştırabilirsin.
Ekran kartını seç, çalışır mı gör →Bağlam uzunluğu
1M token
API giriş (1M token)
$0.3
API çıkış (1M token)
$1.2
Kullanıcı planı
Sadece API
Ücretsiz plan mevcut
Türkçe destek
İyi
Çok modlu
Evet
Hızı
Hızlı
OpenAI uyumlu
Evet
Ne İçin Kullanılır?
- ✓Uzun bağlamlı ajan ve araç çağırma döngüleri
- ✓Yüksek hacimli, maliyete duyarlı API işleri
- ✓Görsel + metin karışık belge işleme
- ✓Yerel/açık ağırlıkla özelleştirme (MIT lisans)
Güçlü Yönler
- ↑552B MoE ama sadece 8B/16B aktif parametre — hızlı ve ucuz
- ↑FP4 KV cache: token başına 890 bayt, 1/4 HBM ve 1/8 SSD
- ↑1M context, 384K maksimum çıkış
- ↑MIT lisansla açık ağırlık, yerel kurulum mümkün
- ↑Off-peak 0,15 / 0,60 dolar; cache hit 0,003 dolar
Dikkat Edilecekler
- ↓Fiyat peak saatlerde iki katına çıkıyor (01:00-04:00 ve 06:00-10:00 UTC)
- ↓Bağımsız SWE-bench Verified ölçümü henüz yok
- ↓Knowledge cutoff resmi olarak açıklanmadı
DeepSeek V4.1 Flash, DeepSeek'in 10 Eylül 2026'da yayınladığı ve şirketin yeni mimari ailesinin ilk üyesi olan model. 552 milyar parametreli bir MoE; ama ilginç olan toplam boyut değil, aktif parametre sayısı — prompt işlerken 8 milyar, cevap üretirken 16 milyar parametre çalışıyor. Yeni Causal Encoder-Decoder (CED) mimarisi üzerine kurulu ve şirketin asıl iddiası KV cache tarafında: FP4 (NVFP4/E2M1) formatına sıkıştırılmış cache, token başına 890 bayta iniyor. DeepSeek'in verdiği rakama göre bu, önceki nesle kıyasla HBM ihtiyacını dörtte bire, SSD ihtiyacını sekizde bire indiriyor. Ajan iş akışlarında — yani aynı bağlamın onlarca kez tekrar okunduğu uzun araç çağırma döngülerinde — maliyeti asıl belirleyen kalem tam olarak bu. Görsel anlama artık ayrı bir model değil, doğrudan modelin içinde. Geçen ay deneysel V4 Flash Vision Exp olarak çıkan yetenek bu sürümde standart hale geldi; V4 Flash ve V4 Flash Vision Exp emekliye ayrıldı, eski isimlerle gelen istekler V4.1 Flash'a yönlendiriliyor. Context window 1 milyon token, maksimum çıkış 384K. Fiyat resmi tabloda off-peak 0,15 / 0,60 dolar; peak saatlerde iki katına çıkıyor (0,30 / 1,20 dolar). Cache hit tarafı çok daha agresif: off-peak 1M token için 0,003 dolar. Ağırlıklar MIT lisansıyla Hugging Face'te açık. DeepSeek kendi yayınladığı karşılaştırmada modelin V4 Pro'yu performans, maliyet, hız ve toplam işlem süresinde geçtiğini söylüyor; GPQA Diamond skoru 90,9 olarak paylaşıldı. Bağımsız SWE-bench Verified ölçümü henüz yayınlanmadı, o yüzden bu alanı boş bıraktım. Türkçe performansı DeepSeek ailesinin genel seviyesinde; kendi testimi yapmadım.
En Yakın Alternatif
Gerekli Programlar
Açık ağırlıklı bir modeli kendi bilgisayarında çalıştırmak için bir model yöneticisi gerekir. İkisi de ücretsiz, ikisi de Windows, Mac ve Linux'ta çalışır.
LM Studio — görsel arayüz isteyenler için
Modeli listeden seçip indiriyorsun, terminal yok. Yeni başlayan için en kısa yol.
Ollama — terminalden çalıştıranlar için
Terminalden tek komutla model indirip çalıştırıyorsun, arayüz yok. Bu modelin Ollama kütüphanesinde hazır bir sürümü olup olmadığını ollama.com'da arayarak görebilirsin.
Donanım tarafı
Büyük modeller için ekran kartı yetmiyorsa, iş istasyonu sınıfı donanımın ne verdiğini rehberde ölçtük.
DGX Spark rehberi →