NVIDIA Nemotron 3 Serisi: Nano, Super, Ultra — Hangi Model Ne İşe Yarar? (2026)

NVIDIA Nemotron 3 ailesi — Nano, Super, Ultra ve Nano Omni. Hangi model hangi iş için, parametreler, ücretsiz OpenRouter endpoint'leri, fiyatlar ve yerelde çalıştırma için gereken gerçek VRAM.
NVIDIA Nemotron 3 Serisi: Nano, Super, Ultra — Hangi Model Ne İşe Yarar? (2026)
NVIDIA, Aralık 2025'te Nano ile başlayıp Haziran 2026'da Ultra ile tamamladığı Nemotron 3 ailesiyle agentici
otonom, çok adımlı görevleri kendi başına yürüten AI tarafında iddialı bir çıkış yaptı. Üç ana model (Nano, Super, Ultra) + multimodal Nano Omni varyantı — hepsi açık ağırlıklı (open-weights), hepsi hybrid Mambai
uzun context'i verimli işleyen state-space mimarisi-Transformer MoEi
Mixture of Experts: her token için modelin sadece küçük bir uzman alt kümesi çalışır yapısında, hepsi OpenRouter'da ücretsiz endpoint'le kullanılabiliyor. Amaçları aynı: otonom AI ajanları, çok adımlı reasoning, kod yazma ve kurumsal görevler.
Bu rehberde serideki tüm modelleri parametrelerinden fiyatına, hangi iş için hangisinin uygun olduğuna kadar anlatıyorum.
Nemotron 3 ailesinin teknik DNA'sı
Dört model de aynı temel mimariyi paylaşıyor: Hybrid Mamba-Transformer + Mixture of Experts (MoE). Geleneksel Transformer'lara Mamba state-space katmanlarını ekleyerek uzun context'lerde hem hız hem doğruluk kazanıyorlar. MoE sayesinde toplam parametrelerinin sadece küçük bir kısmı her token için aktif — bu da inferencei
modelin cevap üretme aşaması maliyetini düşürüyor.
| Özellik | Nano | Nano Omni | Super | Ultra |
|---|---|---|---|---|
| Toplam parametre | ~30B | ~30B | ~120B | ~550B |
| Aktif parametre | 3B | 3B | 12B | 55B |
| Mimari | Hybrid Mamba-Transformer MoE | Hybrid Mamba-Transformer MoE | Hybrid Mamba-Transformer MoE + MTP | Hybrid Mamba-Transformer MoE + MTP |
| Context penceresi | 256K | 256K | 1M (OR ücretsizde 262K) | 1M |
| Modalite | Metin | Metin + Görsel | Metin | Metin |
| Çıkış tarihi | Aralık 2025 | Nisan 2026 | Mart 2026 | Haziran 2026 |
| Lisans | NVIDIA Open Model License | NVIDIA Open Model License | NVIDIA Open Model License | NVIDIA Open Model License |
| Açık kaynak | ✅ (weights + dataset + recipe) | ✅ | ✅ | ✅ |
MTP (Multi-Token Prediction): Super ve Ultra'da bulunan bu özellik, modelin her adımda tek token yerine birden fazla token tahmin etmesini sağlıyor. NVIDIA'ya göre çok adımlı ajan görevlerinde belirgin bir üretim hızı kazancı veriyor.
Context penceresi rakamları modelin desteklediği maksimumu gösterir. OpenRouter gibi platformların ücretsiz katmanları çoğu zaman daha düşük bir sınır sunar (aşağıda ayrıntı var) — tam context'e güvenmeden önce kullandığın provider'ı teyit et.
Nano 30B A3B: Hafif işlerin ajansı
Serinin ana küçük modeli. 30 milyar toplam parametrenin sadece 3 milyarı her token için aktif — bu sayede aynı boyuttaki dense modele göre çok daha hızlı çalışıyor. NVIDIA, Nemotron 2 Nano'ya göre kayda değer bir throughputi
saniyede üretilen token miktarı artışı bildiriyor.
Dikkat: "3B aktif" ifadesi hızı anlatır, bellek ihtiyacını değil. MoE modellerde bütün uzmanlar bellekte durmak zorunda, yani Nano yine de 30B'lik yer kaplar. Gerçekten düşük VRAM'li kartlar için NVIDIA ayrı bir Nano 4B sürümü yayınladı — Jetson ve 6-8 GB'lık kartlarda çalışan asıl "edge" model o (aşağıda donanım tablosuna bak).
Tüm özellikler, benchmark ve mindi skoru: Nemotron 3 Nano model sayfası
Ne için ideal:
- Tek görevli alt-ajanlar (spesifik bir işi yapan botlar)
- Düşük maliyetli, yüksek hacimli inference
- 24 GB sınıfı bir kartın (RTX 3090/4090) varsa yerelde ajan denemeleri
Ne için değil:
- Karmaşık çok adımlı reasoning
- Kod yazma benchmark'larında rekabet
- Uzun context'li ajan zincirleri
Nano'yu kendi bilgisayarında çalıştırmak istersen: LM Studio Bionic Rehberi
Nano Omni 30B A3B: Gözleri olan Nano
Nano'nun multimodal versiyonu. Metin + görsel girdi alabiliyor. Aynı 30B/3B parametre yapısını koruyor ama görsel anlama yeteneği eklenmiş. NVIDIA bunu "multimodal alt-ajan" olarak konumluyor — hafif, görsel okuyabilen ajan görevleri için.
Ne için ideal:
- Görsel + metin içeren hafif agent görevleri
- Ekran görüntüsü okuyan alt-ajanlar
- Düşük maliyetli multimodal pipeline'lar
Super 120B A12B: Tatlı nokta
Serinin fiyat/performans lideri. 120 milyar parametrenin 12 milyarı aktif — Nano'dan 4 kat fazla aktif parametre. MTP ve LatentMoEi
NVIDIA'nın uzman yönlendirme yöntemi ile hızlı üretim yapıyor. Native context penceresi 1M'e kadar çıkıyor.
Tüm özellikler, benchmark ve mindi skoru: Nemotron 3 Super model sayfası
Benchmark öne çıkanlar (NVIDIA'nın paylaştığı sonuçlar):
- AIME 2025 matematik reasoning'de güçlü
- TerminalBench gibi agentic terminal görevlerinde yüksek doğruluk
- SWE-Bench Verified kod görevlerinde rekabetçi
Bunlar NVIDIA'nın kendi ölçümleri — bağımsız testlerde farklılaşabilir, kendi işinde dene.
Ne için ideal:
- Çok ajanlı sistemlerin ana orchestrator'ı
- Kod yazma + debugging agent'ları
- Tool callingi
modelin dış fonksiyonları/araçları çağırması görevleri - Uzun context'li doküman analizi
Ne için değil:
- Tek tüketici kartında yerel çalıştırma (120B bellek yükü ağır)
- En üst düzey reasoning gerektiren en ağır işler (Ultra'ya geç)
Ultra 550B A55B: En ağır işler için
Serinin amiral gemisi. 550 milyar parametre, 55 milyar aktif, 1 milyon token context penceresi. NVIDIA'nın "frontier-reasoning ve orchestration" olarak konumlandırdığı model; 20 trilyon token üzerinde ön-eğitilmiş, ardından context 1M'e uzatılmış. Uzun soluklu ajan işleri için tasarlanmış.
Tüm özellikler, benchmark ve mindi skoru: Nemotron 3 Ultra model sayfası
Ne için ideal:
- Uzun soluklu ajan zincirleri (agent orchestration)
- Derin araştırma (deep research) görevleri
- Karmaşık kurumsal iş akışları
- Multi-step reasoning ve planlama
- Yüksek hacimli ajan pipeline'ları
Ne için değil:
- Yerel bilgisayarda çalıştırma (tek GPU'ya sığmaz, veri merkezi sınıfı donanım ister)
- "Hızlı cevap ver" senaryoları (boyutu nedeniyle latency yüksek)
Fiyatlandırma: Hepsi ücretsiz başlıyor
Nemotron 3 serisinin en çarpıcı yanı: OpenRouter'da dört modelin de ücretsiz (free) endpoint'i var. NVIDIA, modelleri kullandırtmak için agresif bir açık strateji izliyor.
| Model | OpenRouter (free) | OpenRouter (ücretli) |
|---|---|---|
| Nano 30B A3B | $0/M | ücretli katman da mevcut |
| Nano Omni | $0/M | ücretli katman da mevcut |
| Super 120B A12B | $0/M | ~$0.09 / $0.40 (M token) |
| Ultra 550B A55B | $0/M | $0.50 / $2.50 (M token) |
Ücretsiz katman genelde daha kısa context ve düşük rate limit demek; ücretli provider'lar tam context ve üretim yükü için.
Fiyatlar 28 Temmuz 2026'da OpenRouter'dan alındı ve sık değişir. Prompt caching kullanan provider'larda uzun, tekrarlı context'lerde efektif input maliyeti liste fiyatının altına inebilir — ama gerçek oranı kendi kullanımında ölç, peşinen bir indirim varsayma.
[mindi_yorum]
💰 Dört model de OpenRouter'da $0 endpoint'le başlıyor; para vermeden test edebilirsin. Ücretli katmanda bile Ultra $0.50/$2.50 ile bu boyut için ucuz sayılır.
🟡 "Ücretsiz" = sınırsız değil. Free endpoint'ler rate limitli ve genelde daha kısa context'li. Üretim yükünü free tier'a yıkarsan duvara toslarsın.
🔵 Önce Super'in free endpoint'iyle başla; işini görüyorsa ücretli katmana geçmek zaten ucuz.
Nasıl erişilir?
1. OpenRouter (en kolay)
Tüm modeller OpenRouter'da: openrouter.ai/nvidia/nemotron-3-ultra-550b-a55b gibi endpoint'lerle API'den veya chat arayüzünden kullanılabiliyor. Ücretsiz tier mevcut.
OpenRouter'ı hiç kullanmadıysan: OpenRouter Rehberi — Tek API, Tüm Modeller
2. Hermes Agent ile (ücretsiz ajan olarak)
OpenRouter'daki ücretsiz endpoint'i Hermes Agent'a bağlayıp kendi AI ajanını kurabilirsin. Nemotron'u agent modelin yapıp masaüstü işlerini otomatikleştirebilirsin.
Kurulum için: İşlerini Ücretsiz AI Ajanlar Halletsin: Hermes + OpenRouter
3. Hugging Face (yerel / kendi sunucun)
Tüm modellerin weights'leri Hugging Face'te:
- nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
- nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8
- nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4
- Küçük kartlar için: nvidia/NVIDIA-Nemotron-3-Nano-4B-GGUF
vLLM, SGLang, Ollama, llama.cpp ile deploy edilebiliyor. NVIDIA GPU'su şart değil — ama performans için öneriliyor.
4. NVIDIA NIM API (resmi)
NVIDIA'nın kendi managed inference servisi: build.nvidia.com üzerinden NIM endpoint olarak kullanılabiliyor. Kurumsal deployment'lar için.
Yerel çalıştırma: Hangi model hangi donanımda?
MoE'de aktif parametre hızı belirler, VRAM'i değil — bütün uzmanlar bellekte durur. Yani modeli boyutuna göre değil, toplam parametresine göre yerleştirmen gerekir. Aşağıdaki rakamlar Q4 quantize ağırlıkları + makul context için kabaca:
| Model | Kaba VRAM (GGUF Q4) | Gerçekçi donanım |
|---|---|---|
| Nano 4B | ~4-6 GB | RTX 4050/3060, Jetson Orin Nano 8 GB, Apple M1 |
| Nano 30B A3B | ~18-20 GB | RTX 3090/4090 (24 GB sınıfı) |
| Super 120B A12B | ~65-70 GB | Çoklu GPU / workstation (tek 4090'a sığmaz) |
| Ultra 550B A55B | ~300+ GB | 4-8× A100/H100, veri merkezi |
Yani "tüketici kartında Nemotron" istiyorsan doğru adres Nano 4B; 30B A3B için 24 GB'lık bir kart gerekir, Super ve Ultra ise pratikte çoklu GPU / bulut işi.
Yerel AI ile ilgili daha fazlası: Yapay Zekaya Ücret Ödemeden Yerel AI Rehberi
[mindi_yorum]
💰 NVIDIA'nın "hepsi açık, hepsi ücretsiz başlıyor" stratejisi topluluğu kendine çekmek için — tıpkı Meta'nın Llama'da yaptığı gibi. Fark şu: Nemotron 3 sadece weights değil, dataset ve eğitim reçetesini de açıyor.
🟢 Super 120B A12B serinin yıldızı. 12B aktif parametreyle çok daha büyük dense modellerle yarışıyor, MTP ile hızlı. "Bir tane Nemotron seç" desen, bu olur.
🟡 Context penceresi rakamlarına kağıt üstünde güvenme. Model 1M destekliyor olabilir ama kullandığın provider daha azını sunuyor olabilir — free endpoint'ler özellikle kısar. Uzun context'li bir işe girmeden önce teyit et.
🔵 Yerelde denemek isteyip elinde 6 GB kart varsa: 30B'yi değil, Nano 4B GGUF'u indir. LM Studio'da "nemotron-3-nano-4b" arat, Q4_K_M quant'ı seç, dakikalar içinde çalışır.
Hangi Nemotron 3 senin için?
Nano / Nano Omni seç, eğer:
- Tek görevli, hafif ajanlar yazıyorsan
- Yerelde küçük kartla (Nano 4B) denemek istiyorsan
- Edge / mobil deployment düşünüyorsan (görsel gerekiyorsa Nano Omni)
Super seç, eğer:
- Çok ajanlı sistem kuruyorsan
- Kod yazma + tool calling öncelikliyse
- "En iyi fiyat/performans" arıyorsan
Ultra seç, eğer:
- 100K+ token context'li işler yapıyorsan
- Deep research / doküman analizi yapıyorsan
- "En yüksek doğruluk" tek kriterinse (bütçe ve latency'den bağımsız)
Sonuç: Şimdi ne yaparsın
- Dene: OpenRouter'da ücretsiz endpoint'le başla. Super en dengeli seçenek.
- Kendi ajanına bağla: Hermes Agent + OpenRouter kombosuyla Nemotron'u kendi masaüstü ajanın yap.
- Yerelde çalıştır: Küçük kartta Nano 4B GGUF, 24 GB kartta Nano 30B — Hugging Face'ten indir, LM Studio veya Ollama ile dene.
- Üretime al: Yeterince test ettikten sonra OpenRouter ücretli provider veya kendi GPU sunucuna geç.
Bilgiler 28 Temmuz 2026'da OpenRouter, Hugging Face ve NVIDIA developer sayfalarından derlendi. Fiyat, context ve benchmark verileri sık değişir — kullanmadan önce güncel durumu kontrol et.