Nemotron 3.5 Lightning
NVIDIA
Son güncelleme: 12 Ağustos 2026
💻 Bu model yerel bilgisayarında çalıştırılabilir — internet bağlantısı veya API ücreti gerekmez.
NVFP4 checkpoint ile tek H100 ya da DGX Spark; RTX 5090 üzerinde de çalışıyor
LM Studio ile aç — görsel arayüzlü yerel model yöneticisi (Windows, Mac, Linux).
💻 LM Studio'da Nasıl Kullanılır?NVIDIA'nın 11 Ağustos 2026'da açık ağırlıklarla yayınladığı Nemotron 3.5 Lightning, Nemotron 3 ailesinin en küçük üyesi. 30 milyar toplam parametreli bir mixture-of-experts model ama her token için sadece 3 milyar parametre çalışıyor — yani büyük bir modelin kapasitesini küçük bir modelin işlem maliyetiyle veriyor. Tasarım amacı net: uzun süre çalışan ajanların yürütme katmanı. Bir ajanın zamanının çoğu tool call yapmak, sonuç doğrulamak, çıktı formatlamak ve alt ajanlara iş dağıtmakla geçiyor. Bu tekrarlayan trafik için sınır modeli çalıştırmak hem pahalı hem yavaş. Lightning tam bu işi üstlensin diye eğitilmiş — üstelik OpenClaw ve Hermes Agent gibi yaygın ajan harness'larına göre optimize edilmiş. Mimari Mamba-2 + MoE + attention hibriti, context uzunluğu 1 milyon token, ön eğitimde 20 trilyondan fazla token kullanılmış. NVIDIA benzer boyuttaki modellere göre 4 kata kadar yüksek çıktı hızı iddia ediyor; PinchBench'te %86 doğrulukla 10.000 görevi Qwen3.6 35B'den %30 daha hızlı bitiriyor. SWE-bench Verified skoru BF16 ağırlıklarda 51,56. Senin için asıl mesele nerede çalıştığı. NVFP4 ve BF16 checkpoint'leri var; LM Studio, llama.cpp, Ollama ve Unsloth üzerinden yerelde dönüyor, DGX Spark ile RTX 5090 üzerinde test edilmiş. OpenRouter'da ücretsiz bir endpoint'i de var, yani denemek için önce donanım almana gerek yok. Lisans OpenMDW-1.1 — sadece ağırlıklar değil, eğitim verisi ve tarifler de açık. LoRA ya da tam SFT ile kendi işine göre ince ayar yapabiliyorsun. Beklentini doğru kur: bu bir sınır modeli değil. Planlama ve karmaşık akıl yürütmeyi Nemotron 3 Ultra ya da başka bir büyük modele bırakman bekleniyor. NVIDIA'nın aynı gün açtığı NeMo Switchyard yönlendirme kütüphanesi zaten bu iş bölümünü otomatikleştirmek için çıktı: plan yukarı, yürütme aşağı.
Bağlam uzunluğu
1M token
API giriş (1M token)
—
API çıkış (1M token)
—
Kullanıcı planı
—
Ücretsiz plan mevcut
Türkçe destek
Orta
Çok modlu
Hayır
Hızı
Hızlı
OpenAI uyumlu
Evet
SWE-Bench
51.56%
Ne İçin Kullanılır?
- ✓Ajan yürütme katmanı: tool call, sonuç doğrulama, formatlama
- ✓Yerel ve offline ajan kurulumları
- ✓Yüksek hacimli sınıflandırma ve özetleme
- ✓Kendi verinle ince ayar (LoRA / SFT)
Güçlü Yönler
- ↑Boyutuna göre çok yüksek çıktı hızı — 4 kata kadar
- ↑1 milyon token context
- ↑Ağırlık, veri ve eğitim tarifleri tamamen açık (OpenMDW-1.1)
- ↑Tek GPU veya DGX Spark üzerinde yerelde çalışıyor
- ↑OpenClaw ve Hermes Agent harness'larına göre eğitilmiş
Dikkat Edilecekler
- ↓Sınır modeli değil — karmaşık planlamada yetersiz kalıyor
- ↓Türkçe çıktı kalitesi bağımsız olarak test edilmedi
- ↓Multimodal değil, sadece metin
- ↓Hız ve doğruluk iddiaları büyük ölçüde NVIDIA'nın kendi ölçümleri