Together AINedir?
KodAçık kaynak AI modellerini tek API'den çalıştır, fine-tune et ya da NVIDIA GPU kümesi kirala.

Mindi Ne Düşünüyor?✅ DeepSeek V4 Pro, MiniMax M3, GLM-5.2, Kimi K3 gibi açık modelleri OpenAI uyumlu tek API'den çağırıyorsun; aynı hesapta fine-tuning, değerlendirme ve saatlik H100/B200 kiralama da var.
⚠️ Ücretsiz deneme yok — hesabı açmak için minimum 5$ kredi yüklemen gerekiyor.
🔀 Sadece düşük gecikmeli inference lazımsa Groq daha dar ve basit bir seçim; Together fine-tuning ve GPU kümesi gerektiğinde öne çıkıyor.
Thinking Machines'in 552,8 milyar parametreli Inkling modeli serverless listesine eklendi — 524.288 token bağlam, NVFP4 quantization, 1M token başına 1,00$ girdi / 4,05$ çıktı / 0,17$ cache'li girdi. Aynı gün Dedicated Model Inference elden geçti: tek komutla endpoint kurulumu, A/B testi ve gölge deney desteği, istek ya da GPU metriğine göre otomatik ölçekleme, boşta sıfıra inme.
Mindi Skoru





Yorum bırakmak için giriş yapmanız gerekiyor.
Together AI Hakkında
✓ Together AI Kimler İçin?
✕ Together AI Kimler İçin Uygun Değil?
Together AI Detaylı İnceleme
Together AI'ı en yalın haliyle şöyle tarif edebilirim: kapalı model API'lerinin yaptığı işi açık kaynak modellerle yapan bir bulut. Llama, DeepSeek, Qwen, Kimi, GLM ya da gpt-oss'u kendi sunucuna kurmadan, OpenAI uyumlu tek bir uçtan çağırıyorsun; işin büyürse aynı platformda fine-tune ediyor, gerekirse doğrudan GPU kümesi kiralıyorsun.
Şirket 2022'de kuruldu. Kurucu kadroda CEO Vipul Ved Prakash'ın yanında Stanford'dan Ce Zhang, Percy Liang ve Chris Ré var — FlashAttention gibi, bugün neredeyse her LLM eğitiminde kullanılan tekniklerin çıktığı çevre. Temmuz 2026'da Aramco Ventures liderliğinde 800 milyon dolarlık Series C aldı ve değerlemesi 8,3 milyar dolara çıktı; Şubat 2025'teki turun 2,5 katı.
Rakiplerinden farkı kapsam. Groq ya da OpenRouter tek bir işi (hızlı inference, model yönlendirme) iyi yapar; Together inference, fine-tuning, değerlendirme, sandbox ve çıplak GPU kümesini aynı faturada topluyor.
Temel Özellikler
Serverless inference. Yüzlerce açık modeli token başına ücretle çağırıyorsun; metin dışında görsel, video, ses, transkripsiyon, embedding ve moderasyon modelleri de var. Batch API'yle toplu işlerde daha ucuza çalışıyorsun.
Provisioned Throughput. Temmuz 2026'da eklendi. GPU saati hesabı yapmak yerine "throughput unit" alıyorsun; kapasite rezerve, fatura öngörülebilir. MiniMax M3 ve GLM-5.2 gibi modellerde PTU dakikası 0,05$.
Dedicated inference. Modeli tek kiracılı GPU'da çalıştırıyorsun — sabit performans, hard rate limit yok, kendi özel modelini de deploy edebiliyorsun. H100 saatlik 5,49$, B200 8,99$.
Fine-tuning. LoRA veya tam fine-tuning, DPO desteğiyle. 16B'ye kadar modellerde LoRA 1M token başına 0,48$; DeepSeek ve GLM-5 gibi büyük modeller için ayrı fiyat tablosu var. Her işte minimum 4$ ücret uygulanıyor.
Evaluations. Kendi alanın için LLM-as-a-judge değerlendirme setleri kuruyorsun: modelleri, promptları ve konfigürasyonları karşılaştır, çıktıları puanla ve sınıflandır.
Sandbox. LLM'in ürettiği kodu güvenli çalıştırmak için code interpreter (60 dakikalık oturum 0,03$) ve daha büyük geliştirme ortamları için vCPU/RAM bazlı ücretlendirilen VM sandbox'lar.
GPU Clusters. H100 saatlik 3,99$'dan başlıyor, H200 5,99$, B200 8,19$. 7 günden uzun rezervasyonlarda fiyat kademeli düşüyor; GB200 ve GB300 NVL72 için satışla görüşmen gerekiyor.
Kullanım Senaryoları
Kapalı model API faturası şişen ürün ekipleri için en somut kullanım, iş yükünün bir kısmını açık modele kaydırmak — sınıflandırma, özetleme, etiketleme gibi "frontier model gerekmeyen" işler.
Kendi verisiyle model şekillendirmek isteyenler için fine-tuning + evaluation ikilisi tek yerde: eğitiyorsun, LLM-as-a-judge ile ölçüyorsun, aynı API'den servis ediyorsun.
Araştırmacılar ve model eğiten ekipler için GPU kümesi tarafı var; saatlik başlayıp aylık rezervasyona geçebiliyorsun.
Ajan geliştirenler içinse sandbox ve batch API kombinasyonu iş görüyor: ajanın ürettiği kodu izole çalıştır, toplu işleri gece indirimli tarifede geçir.
Fiyatlandırma
Ücretsiz deneme yok; hesabı açmak için minimum 5$ kredi yüklüyorsun. Ödeme kullandıkça.
Serverless inference (1M token, girdi/çıktı):
| Model | Girdi | Çıktı |
|---|---|---|
| gpt-oss-120B | 0,15$ | 0,60$ |
| MiniMax M3 | 0,30$ | 1,20$ |
| Qwen3.7-Plus | 0,32$ | 1,28$ |
| GLM-5.2 | 1,40$ | 4,40$ |
| DeepSeek V4 Pro | 1,74$ | 3,48$ |
| Kimi K3 | 3,00$ | 15,00$ |
Compute ve şekillendirme:
| Kalem | Fiyat |
|---|---|
| GPU cluster — H100 / H200 / B200 (saatlik) | 3,99$ / 5,99$ / 8,19$ |
| Dedicated inference — H100 / B200 (saatlik) | 5,49$ / 8,99$ |
| Fine-tuning (16B'ye kadar, LoRA, 1M token) | 0,48$ |
| Code interpreter (60 dakikalık oturum) | 0,03$ |
| Paylaşımlı dosya sistemi | 0,16$ / GiB / ay |
Fiyatlar sık değişiyor ve model listesi neredeyse her hafta güncelleniyor; kritik bir hesap yapacaksan resmi fiyat sayfasından teyit et.