NVIDIA'nın açık embedding modeli Nemotron 3 Embed retrieval sıralamasında birinci
NVIDIA, 16 Temmuz'da üç açık embedding modelinden oluşan Nemotron 3 Embed koleksiyonunu yayınladı; 8 milyar parametreli modeli RTEB retrieval sıralamasında 78,46 puanla birinci sıraya yerleşti. Ticari kullanıma açık, ama değerlendirilen 34 dil arasında Türkçe yok.
NVIDIA 16 Temmuz'da Nemotron 3 Embed'i yayınladı — RAG sistemleri, ajan hafızası ve kod araması için tasarlanmış üç açık modelden oluşan bir koleksiyon. Amiral gemisi 8 milyar parametreli model, retrieval kalitesini ölçen RTEB sıralamasında 78,46 puanla ilk sıraya oturdu.
Koleksiyonda ne var
Üç model var: 8B-BF16 doğruluk odaklı amiral gemisi, 1B-BF16 daha küçük dağıtım ayak izi için, 1B-NVFP4 ise Blackwell mimarisine optimize edilmiş 4-bit kuantizei
Modeli daha az bellek kullanacak şekilde düşük hassasiyete indirme. varyant. Üçü de 32.768 token'lık girdi uzunluğunu destekliyor, yani uzun dokümanları ve çok turlu geçmişi tek seferde işleyebiliyor.
Sayılar ne diyor
8B modeli benchmarki
Modelleri standart görevlerde ölçen test setleri. sonuçlarında RTEB'de 78,46, MMTEB Retrieval'de 75,45 ve ViDoRe-V3 metin setinde 60,60 aldı. 1B versiyonu RTEB'de 72,38'de kalıyor — ama NVIDIA'nın önceki nesil 1B modeli 61,98'deydi, yani küçük modelde on puanlık bir sıçrama var. Model, Ministral-3-8B-Instruct tabanının nedensel çözücüsünün çift yönlü kodlayıcıya çevrilmesiyle kuruldu ve 50 milyondan fazla soru-pasaj çiftiyle eğitildi.
Türkçe listede yok
Model kartında değerlendirildiği belirtilen 34 dil arasında Arapça, Farsça, Urduca, Svahili, Tamilce ve Hintçe var — Türkçe yok. Bu, modelin Türkçe metinde hiç çalışmayacağı anlamına gelmiyor; ölçülmediği anlamına geliyor. Türkçe bir bilgi tabanı üzerine arama kuracaksan performansı kendi verinle test etmen gerekir, sıralamadaki birincilik burada bir garanti vermiyor.
Kullanmak için ne gerekiyor
Lisans OpenMDW-1.1, ticari kullanıma açık. Ancak modeller şu an hiçbir inferencei
Eğitilmiş modeli çalıştırıp çıktı üretme aşaması. sağlayıcısında hazır servis olarak sunulmuyor — kendi CUDA'lı GPU'nda çalıştırman gerekiyor. Test edilen donanım A100 ve H100; Ampere, Hopper ve Blackwell mimarileri destekleniyor, işletim sistemi Linux. 8B modeli her metni 4096 boyutlu bir vektöre çeviriyor, istersen bu vektörü 2048 veya 1024 boyuta kırpıp yeniden normalleştirebiliyorsun — depolama maliyetini düşürmek isteyenler için pratik bir kaçış yolu.

Embedding modelleri sohbet modelleri kadar gürültü çıkarmıyor ama RAG kuran herkesin cevap kalitesini asıl belirleyen katman burası; yanlış pasajı getiren bir sistemin arkasında ne kadar iyi bir model olursa olsun cevap yanlış çıkıyor. Bu yüzden 1B modelin bir önceki nesle göre on puan atlaması, 8B'nin birinciliğinden daha ilgi çekici — küçük model kendi sunucunda çalışacak olan. Türkçe'nin ölçülen diller arasında olmaması ise bu tabloda tekrar eden bir sahne: model muhtemelen fena çalışmaz, ama "muhtemelen" ile üretime çıkmak, kendi verinle yarım saatlik bir test yapmaktan daha pahalıya patlıyor.