Gemini 3.8 Text-to-Speech: Yeni Modeller Ne Sunuyor?
Google'ın yeni Gemini 3.8 text-to-speech modelleri fiyatı düşürürken kaliteyi artırdı. Flash ve Flash-Lite arasındaki farkları inceledik.

Gemini 3.8 text-to-speech, Google'ın 23 Eylül 2026'da tanıttığı ses üretim sistemidir. Flash TTS ve Flash-Lite TTS olarak iki sürümden oluşur. İşletmeler için sesli asistan, seslendirme ve müşteri deneyimi projelerinde maliyeti düşürüp kaliteyi artırır.
Kısaca:
- İki model: Flash TTS (yüksek kalite) ve Flash-Lite TTS (yüksek hacim, düşük maliyet)
- 100'den fazla dil, 2000'den fazla hazır ses, özel ses tasarımı desteği
- Fiyat milyon token başına 9 dolara indi, önceki modele göre yaklaşık yüzde 55 daha ucuz
- Google AI Studio ve Gemini API üzerinden erişilebilir, SynthID filigranı içerir
Gemini 3.8 text-to-speech nedir?
Bu sistem, Google DeepMind'ın geliştirdiği yeni nesil ses üretim modelleri serisidir. Metni doğal, insan sesine yakın konuşmaya çeviriyor. Model ailesi iki üründen oluşuyor: Flash TTS ve Flash-Lite TTS (DeepMind).
Bu modeller doğal dil ile ses tasarımı yapmayı mümkün kılıyor. Satır satır performans yönlendirmesi sayesinde konuşmanın tonu, hızı ve duygusu kontrol edilebiliyor. Ayrıca 100'den fazla dil desteği sunuyor.
Türkçe konuşan işletmeler için bu, çok dilli sesli ürünler geliştirmeyi kolaylaştırıyor. Tek bir modelle farklı pazarlara hitap edebilirsiniz.
Flash TTS ve Flash-Lite TTS arasındaki fark ne?
Flash sürümü, özel ses tasarımı ve yüksek kaliteli çıktı için tasarlandı. Sıfırdan yeni bir ses yaratabilir ya da sadece 30 saniyelik bir ses örneğinden mevcut bir sesi çoğaltabilir (DeepMind).
Flash-Lite TTS ise farklı bir amaca hizmet ediyor. Yüksek hacimli, maliyet açısından verimli üretim senaryolarına odaklanıyor. Sesli ajanlar, otomatik okuma özellikleri ve toplu içerik üretimi için uygun.
Kısacası Flash stüdyo kalitesinde iş için, Flash-Lite ise ölçekli operasyonlar için düşünülmüş. İşletmeler ihtiyaçlarına göre ikisi arasında seçim yapabilir.
Fiyatlandırma nasıl değişti?
Bu model ailesi, önceki sürüme göre belirgin şekilde ucuzladı. Yeni fiyat milyon token başına 9 dolar seviyesinde, 2026 sonu itibarıyla geçerli (OrcaRouter).
Önceki Gemini 3.1 Flash TTS Preview modeli milyon ses tokenı başına 20 dolardı. Bu da yaklaşık yüzde 55'lik bir fiyat düşüşü anlamına geliyor.
Ses saniye başına yaklaşık 25 token olarak hesaplanıyor. Bu da saniye başına yaklaşık 0.02 sent gibi düşük bir maliyete tekabül ediyor. Yüksek hacimli sesli içerik üreten işletmeler için bu fark önemli bir bütçe avantajı sağlıyor.
Kalite açısından rakiplerinden farkı var mı?
Bu modeller, bağımsız bir kalite testinde iyi sonuç aldı. Hume AI Voice Design Benchmark'ta Flash TTS genel kategoride birinci sırada yer aldı, 71.4 puanla (DeepMind).
| Gemini 3.8 Flash TTS* (genel) | 71.4 |
|---|---|
| Gemini 3.8 Flash TTS* (aksan) | 60.8 |
Kaynak: DeepMind
Aksan modellemesi kategorisinde de lider konumda, 60.8 puanla. Bu sonuçlar, modelin sadece hızlı değil aynı zamanda kaliteli ses ürettiğini gösteriyor. Aksan ve tonlama hassasiyeti gerektiren projeler için bu önemli bir avantaj.
Öne çıkan özellikler nelerdir?
Bu sistem, gerçekçi konuşma dokuları eklemeye izin veriyor. Geri-kanallaştırma özelliği sayesinde "|mhm|" veya "|yeah|" gibi doğal sesli tepkiler ekleyebilirsiniz (DeepMind).
Kontrol edilebilirlik de öne çıkan bir yön. Yapılandırılmış speech_metadata açıklaması ve satır içi ses etiketleriyle stil, aksan, hız ve ton yönlendirilebiliyor (Google AI Developers).
Aşağıda öne çıkan teknik sınırlar ve özellikler yer alıyor:
| Özellik | Detay |
|---|---|
| Dil desteği | 100'den fazla dil |
| Hazır ses seçeneği | 2000'den fazla |
| Özel ses örneği süresi | 30 saniye |
| Çoklu konuşmacı desteği | Tam olarak 2 konuşmacı |
| Maksimum çıktı süresi | Yaklaşık 655 saniye |
Çoklu konuşmacı yapılandırması şu anda sadece iki konuşmacıyı destekliyor (Firebase). Maksimum çıktı süresi ise yaklaşık 655 saniye; bu limiti aşan metinler kesiliyor (Google Cloud).
Güvenlik ve doğrulama nasıl sağlanıyor?
Bu model ailesi, ses kimliği doğrulaması konusunda ek önlemler içeriyor. Modeller yerleşik izin doğrulaması ile geliyor, bu da izinsiz ses kopyalamayı zorlaştırıyor.
Ayrıca C2PA kimlik bilgileri ve SynthID filigranı kullanılıyor (DeepMind). Bu iki teknoloji, üretilen sesin yapay zeka tarafından oluşturulduğunu doğrulamaya yarıyor.
İşletmeler için bu, hem yasal uyum hem de kullanıcı güveni açısından önemli. Sahte ses içeriklerine karşı bir savunma katmanı oluşturuyor.
Nereden erişilebilir?
Bu modeller, Google AI Studio ve Gemini API üzerinden kullanılabiliyor. Geliştiriciler bu araçlarla mevcut uygulamalarına ses üretimi ekleyebiliyor.
Sesli asistan, e-öğrenme platformu veya müşteri hizmetleri botu geliştiren ekipler için entegrasyon nispeten hızlı. Benzer şekilde yapay zeka modellerindeki fiyat-performans dengesini merak edenler Claude Opus 5.5 analizimize de göz atabilir.
Sıkça sorulan sorular
Gemini 3.8 TTS, önceki modellere kıyasla ne kadar ucuz?
Yeni fiyat milyon token başına 9 dolar, önceki Gemini 3.1 Flash TTS Preview ise 20 dolardı. Bu yaklaşık yüzde 55'lik bir düşüş anlamına geliyor.
Flash mı, Flash-Lite mı tercih etmeliyim?
Flash, özel ses tasarımı ve yüksek kalite gerektiren stüdyo işleri için uygundur. Flash-Lite ise yüksek hacimli, maliyet açısından verimli üretim senaryoları için tasarlanmıştır.
Özel bir ses nasıl oluşturulur?
Doğal dil talimatlarıyla sıfırdan yeni bir ses yaratabilirsiniz. Alternatif olarak sadece 30 saniyelik bir ses örneğiyle mevcut bir sesi çoğaltmak da mümkün.
Hangi dilleri destekliyor?
Sistem 100'den fazla dili destekliyor, bölgesel aksanlar dahil. Ayrıca 2000'den fazla hazır ses seçeneği sunuyor.
Bu model ailesi, düşen fiyatı ve gelişmiş kontrol seçenekleriyle sesli ürünler için pratik bir seçenek sunuyor. İşletmenize uygun sesli deneyimi tasarlamak istiyorsanız EngerekTech ekibiyle bu tür entegrasyonları konuşabilirsiniz.
Kaynaklar
GoogleGemini 3.8 text-to-speech says helloGemini 3.8 Flash-Lite TTS and Gemini 3.8 Flash TTS are our most expressive audio models yet.
Google AI for DevelopersText-to-speech generation (TTS) | Gemini API | Google AI for DevelopersGet started generating audio with the Gemini API
OrcaRouterGemini 3.8 Flash TTS: Google's Speech Line Splits in TwoGoogle's Gemini 3.8 Flash TTS and Flash-Lite TTS cut audio output to $9.00 per 1M tokens, add voice design and cloning, and split the line in two.

