NVIDIA'dan ajanların angarya işleri için 30B açık model: Nemotron 3.5 Lightning
İlgili Modeller

NVIDIA, 30 milyar parametreli açık ağırlıklı Nemotron 3.5 Lightning'i yayınladı — her token için sadece 3 milyar parametre çalışan, ajanların yüksek hacimli işleri için tasarlanmış bir model. Yanında NeMo Switchyard adlı model yönlendirme kütüphanesi de açık kaynak oldu.
NVIDIA 11 Ağustos'ta Nemotron 3.5 Lightning'i açık ağırlıklarla yayınladı. Model 30 milyar parametreli bir mixture of expertsi
Her token'ı çok sayıda uzman alt-ağdan sadece birkaçına yönlendiren mimari. yapısına sahip ama her token için bunların yalnızca 3 milyarı çalışıyor. Sonuç, büyük bir modelin kapasitesini küçük bir modelin işlem maliyetiyle almak.
Neden küçük bir model
Uzun süre çalışan bir ajan zamanının çoğunu düşünmekle değil angaryayla geçiriyor: tool call yapmak, dönen sonucu doğrulamak, çıktıyı formatlamak, alt ajanlara iş dağıtmak. Bu adımların her birinde sınır modeli çağırmak hem faturayı hem gecikmeyi şişiriyor. Lightning tam bu yürütme katmanı için eğitilmiş; şirket modeli OpenClaw ve Hermes Agent gibi yaygın ajan harness'larına göre ayarladığını söylüyor.
Teknik tarafta ne var
Mimari Mamba-2, MoE ve attention karışımı bir hibrit. Context windowi
Modelin bir seferde işleyebildiği metin miktarı. 1 milyon token, ön eğitimde 20 trilyondan fazla token kullanılmış. Benzer boyuttaki modellere kıyasla 4 kata kadar yüksek çıktı hızı iddia ediliyor; PinchBench testinde yüzde 86 doğrulukla 10.000 görev, Qwen3.6 35B'den yüzde 30 daha hızlı bitirilmiş. SWE-bench Verified skoru BF16 ağırlıklarda 51,56.
Yerelde çalışıyor
NVFP4 ve BF16 checkpoint'leri var; LM Studio, llama.cpp, Ollama ve Unsloth destekliyor. DGX Spark ve RTX 5090 üzerinde test edilmiş. Donanımın yoksa OpenRouter'da ücretsiz bir endpoint'i de duruyor. Lisans OpenMDW-1.1: ağırlıklar, eğitim verisi ve tarifler açık, LoRA ya da tam SFT ile ince ayar yapılabiliyor. Sıfır bütçeyle ajan kurmayı merak ediyorsan şu kurulum rehberine göz atabilirsin.
Yanında bir de yönlendirici geldi
NeMo Switchyard, gelen her isteği o işi yapabilecek en ucuz modele gönderen açık kaynak bir kütüphane. Mantığı basit: planlama yukarı, yürütme aşağı. LangChain'in 145 görevlik kıyaslamasında maliyeti yüzde 74 düşürdüğü, karşılığında yaklaşık 6 puan doğruluk verdiği bildiriliyor.

30B'lik bir model 4 kat hız için var, yani mesele zekâ değil, faturanın hangi katmanda şiştiği. Ajan kuranların çoğu her adımda en pahalı modeli çağırıyor; Switchyard tam oraya bakıyor. Bir uyarı: hız ve doğruluk rakamlarının neredeyse tamamı NVIDIA'nın kendi ölçümü, bağımsız test gelene kadar temkinli oku. Türkçe çıktı kalitesini de henüz kimse ölçmedi, küçük modellerin genelde en zayıf tarafı orası.
Bu haber NVIDIA Technical Blog kaynağındaki içerikten mindi tarafından Türkçeye derlenmiştir.