VoiceStudioNedir?
SesSes klonlama, ses tasarımı, video dublajı, dikte ve sesli kitap üretimini tek masaüstü uygulamasında toplayan açık kaynak araç. Bütün işlemler kendi bilgisayarında çalışıyor, arayüzü Türkçe.

Mindi Ne Düşünüyor?✅ Kurulumdan sonra hesap, kredi ya da API anahtarı istemiyor: klonlama, dublaj ve dikte tamamen cihazda çalışıyor. Arayüzün Türkçe çevirisi var, üretim tarafı 646 dil destekliyor.
⚠️ Varsayılan modelin ağırlıkları ticari kullanıma kapalı (CC-BY-NC); şirket içi üretimde bunu bilerek karar ver. İlk Docker açılışı model indirdiği için uzun sürüyor.
🔀 ElevenLabs bulutta konuşma kalitesinde hâlâ önde ama krediyle çalışıyor; VoiceStudio sınırsız üretimi kendi donanımına taşıyor.
Mindi Skoru





Yorum bırakmak için giriş yapmanız gerekiyor.
VoiceStudio Hakkında
✓ VoiceStudio Kimler İçin?
✕ VoiceStudio Kimler İçin Uygun Değil?
VoiceStudio Detaylı İnceleme
VoiceStudio, ses işlerini bulut aboneliğinden çıkarıp kendi bilgisayarına taşımak isteyenler için yazılmış açık kaynak bir masaüstü uygulaması. Proje Palash Debnath tarafından geliştiriliyor; Nisan 2026'da yayına açıldı, Eylül 2026'da 38 bine yakın GitHub yıldızına ulaştı ve aynı yıl OmniVoice Studio adından VoiceStudio'ya geçti. Kod AGPL-3.0 lisanslı: indirip kuruyorsun, hesap açmıyorsun, üretim için kredi ya da API anahtarı girmiyorsun.
Farkı tek bir özellikte değil, iş akışının tamamını aynı pencerede toplamasında. Ses klonlama, ses tasarımı, video dublajı, dikte ve sesli kitap üretimi ayrı araçlar olarak satılıyor; VoiceStudio bunları yerel modellerle tek uygulamada yapıyor. Üç saniyelik bir kayıt klonlama için yetiyor, tek cümlelik tarifle sıfırdan ses tasarlanabiliyor ve üretim 646 dilde çalışıyor.
Temel Özellikler
Ses klonlama, elindeki kısa bir klipten konuşma tarzını çıkarıp yeni metni o sesle okutuyor. Klonlanan sesler cihazda kalıyor, bir hesaba ya da sunucuya yüklenmiyor.
Ses tasarımı, kayıt olmadan sıfırdan ses kurmanı sağlıyor: cinsiyet, yaş, aksan, perde ve duygu seçiyorsun, çıkan sesi ses galerisinden hazır örneklerle karşılaştırıyorsun.
Video dublajı, altyazı ve çeviri adımlarını birlikte yürütüyor: videonun sesi yazıya dökülüyor, çevirisi yapılıyor, yeni sesle okunuyor ve her konuşmacı kendi sesinde kalıyor. Zamanlama otomatik hizalanıyor.
Dikte, ekranda duran küçük bir pencere üzerinden çalışıyor; hangi uygulamada yazıyorsan oraya metni bırakıyor. Aynı yerden ses ve video dosyalarını yazıya dökebiliyorsun.
Sesli kitap ve hikâye üretiminde her karaktere ayrı ses atayabiliyorsun; uzun metin bölümlere ayrılıp tek seferde okunuyor.
Yerel API ve MCP desteği var: ürettiği sesleri localhost:3900 adresindeki OpenAI uyumlu ses API'sinden başka uygulamalara açabiliyor, ajan araçlarına MCP üzerinden bağlanabiliyor. Kendi sunucusunda koşturmak isteyenler için Docker imajı da yayınlanıyor.
Kullanım Senaryoları
YouTube ya da sosyal medya için video üreten biri, elindeki kayda kendi sesini klonlayıp Türkçe dublaj çıkarabiliyor; ayrı bir dublaj servisine bütçe ayırmıyor.
Eğitim veren ya da toplantı yapan bir ekip, kaydı yüklediği yerden yazıya döküp not çıkarıyor. Kayıt cihazdan çıkmadığı için müşteri görüşmesini buluta gönderme derdi olmuyor.
Kitap ya da bülten çıkaran bir yayıncı, tek metinden bölümlü sesli kitap üretiyor ve karakterlere ayrı ses atıyor.
Ürününe ses özelliği ekleyen bir geliştirici, yerel API'yi açıp kendi uygulamasını aynı motora bağlayabiliyor; MCP desteği sayesinde ajan araçları da bu sesleri kullanabiliyor.
Fiyatlandırma
| Ne veriyor | Ücret | |
|---|---|---|
| Açık kaynak sürüm | Klonlama, ses tasarımı, dublaj, dikte, sesli kitap, yerel API ve MCP — sınırsız kullanım | Ücretsiz (AGPL-3.0) |
| Pro lisans | Aynı uygulama; kapalı kaynak ürüne gömüp dağıtmak isteyenler için AGPL yükümlülüğü olmayan ticari lisans | Fiyat listesi yayınlanmadı, online satın alma yok — pro@voicestudio.sh üzerinden teklif |
| Cloud | Barındırılan ses ve dublaj API'si | Erken erişim listesi açık; ücretsiz kullanım kredisi vaat ediliyor, plan ve fiyat açıklanmadı, API uç noktası henüz yayınlanmadı |
Uygulamanın kendisini indirmek ücretsiz ve kullanım sayısında bir sınır yok. Ödediğin şey yazılım değil, donanım ve elektrik: ilk çalıştırmada model dosyaları yaklaşık 10 GB yer kaplıyor, uygulama 8 GB RAM istiyor (16 GB öneriliyor), ekran kartı zorunlu değil — 4 GB VRAM ile CPU'ya devrederek de çalışıyor.
Dikkat Edilecekler
Uygulama açık kaynak ama varsayılan ses modelinin ağırlıkları CC-BY-NC: ticari ürüne gömüp satmak için ayrı lisans gerekiyor. Kodu değiştirip ağ üzerinden hizmet olarak sunarsan AGPL gereği kaynak kodunu da açman gerekiyor.
Arayüzün Türkçe çevirisi tamamlanmış, üretim tarafı 646 dil listeliyor. Motor tarafında seçenek bol: uygulama 26 motor adaptörüyle geliyor (OmniVoice, CosyVoice 3, VoxCPM2, GPT-SoVITS, IndexTTS, KittenTTS gibi ses motorları; WhisperX, Faster-Whisper, Parakeet gibi yazıya dökme motorları). Listede hangi dilde kalitenin ne olduğuna dair bir ölçüm yayınlanmıyor; Türkçe çıktıyı kendi metninle denemek gerekiyor.
Windows kurulum dosyası GitHub Releases'te yayınlanıyor; indirme sayfasındaki durum etiketleri bazen geçici olarak "mevcut değil" görünüyor, o yüzden sürüm notlarından da doğrulaman iyi olur.