Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe: Toplantı Deşifreleri, Erişim ve Alternatifler (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe: Toplantı Deşifreleri, Erişim ve Alternatifler (2026)

Google, Gemini 3.5 Transcribe modelini 26 Ağustos 2026'da tanıttı. Bu model, ham sesi biçimlendirilmiş metne dönüştüren, önceden kaydedilmiş dosyalarda konuşmacı ataması ve kelime düzeyinde zaman damgaları sunan bir sesten metne (speech-to-text) modelidir. Bu kılavuzda, nelerin sunulduğunu, bunu nerelerde kullanabileceğinizi ve bir transkriptin gönderilebilir bir belgeye dönüşmesi için hala nelerin yapılması gerektiğini ele alıyoruz.

Google'ın 26 Ağustos'ta duyurduğu yenilikler

Duyuru kısa ve net. Google bunu "akıllı sesli etkileşimler için tasarlanmış, şimdiye kadarki en hassas sesten metne modelimiz" olarak tanımlıyor.

Bu yaklaşım, eski ses tanıma teknolojileriyle tam bir tezat oluşturuyor. Google'ın duyurusuna göre, geleneksel modeller "arka plan gürültüsü, karmaşık jargon ve akıcı olmayan konuşmaların temizlenmesi konusunda zorlanıyor." Google, bu yeni modelin ise "ham sesi doğrudan doğru, pürüzsüz ve biçimlendirilmiş metne dönüştürdüğünü" belirtiyor.

İki doğruluk oranı yayınlandı. Artificial Analysis tarafından yapılan ölçümlere göre model, akış (streaming) için %4.0 ve akış dışı (non-streaming) kullanım senaryoları için ortalama %2.6 Kelime Hata Oranına ulaşıyor.

Google ayrıca bu modeli daha önce kullandığı Chirp 3 ile karşılaştırıyor. Nihai çıktı süresi "%70 oranında iyileşiyor" ve FLEURS kıyaslamasında akışta %5.50, akış dışında ise %5.04 WER kaydediyor.

Bu rakamlar, sonucun formatından daha az önem taşıyor. Daha temiz bir ham metin dosyası, herhangi biri kullanmadan önce üzerinde daha az düzenleme yapılması anlamına gelir.

Modelin sunulduğu iki yöntem

İki ayrı API bulunuyor ve toplantılar ana kullanım senaryonuz ise bu ayrım önem taşıyor.

Mod Model Kimliği Ne için tasarlandı
Gerçek zamanlı akış gemini-3.5-transcribe-live Live API aracılığıyla saniye altı gecikmeyle kesintisiz çift yönlü akış
Önceden kaydedilmiş ses gemini-3.5-transcribe Interactions API aracılığıyla kaydedilmiş ses, toplantılar ve arama günlükleri

Önceden kaydedilmiş ses yolu, toplantı özelliklerini barındıran seçenektir. Google bunu "kaydedilmiş sesleri, toplantıları, arama günlüklerini ve daha fazlasını konuşmacı ataması ve kelime düzeyinde zaman damgalarıyla" yazıya dökmek olarak tanımlıyor.

Konuşmacı desteğinin belirtilen bir sınırı vardır. Model, "önceden kaydedilmiş seslerdeki konuşmaları üç konuşmacıya kadar zaman damgalarıyla doğru bir şekilde atar" ve üçten fazlası için destek deneysel olarak tanımlanır.

Akıllı transkripsiyonun gerçekte neleri değiştirdiği

Listelenen dört yetenek, düz bir transkript ile arasındaki pratik farkı ortaya koyuyor.

Akıcı olmayan konuşmaların temizlenmesi. Model, "Salı günü buluşalım—hayır, Çarşamba" gibi kendi kendini düzeltmeleri yönetir, dolgu kelimeleri kaldırır ve çıktıyı otomatik olarak biçimlendirir.

Özel kelime dağarcığı. Süreç boyunca özel jargonların ve sıra dışı yazımların korunması için kendi terimlerinizi sağlayabilirsiniz.

Alfanümerik doğruluk. Google, genel modellerin genellikle başarısız olduğu "posta kodları ve sipariş kimlikleri gibi alfanümerik varlıkları" özellikle vurguluyor.

Dil kapsamı. Model, bölgesel aksanlar ve lehçeler de dahil olmak üzere 85'ten fazla dili otomatik olarak algılar.

Ayrıca belirtmeye değer bir işlev çağırma yeteneği de bulunuyor. Google, modelin "işlev çağrıları aracılığıyla karmaşık görevleri (görüntü oluşturma ve dosya analizi gibi) diğer Gemini modellerine devredebileceğini" söylüyor. Bu yetenek şu anda yalnızca Gemini macOS uygulaması için listelenmiştir.

Bugün nerelerde kullanabilirsiniz?

Bu sadece API'ye özel bir sürüm değil, ki bu bir model lansmanı için alışılmadık bir durumdur.

Platform Orada ne işe yarar
Google AI Studio'daki Gemini API Sesle uygulama kodlama dahil olmak üzere geliştirme modu
Gemini Enterprise Agent Platform Aynı model, kurumsal dağıtım yolu
Android'de Gboard Rambler özelliği konuşmayı biçimlendirilmiş metne dönüştürür
macOS'teki Gemini uygulaması Ekran bağlamıyla eşleştirilmiş sesli komutlar
Google Antigravity Ekran bağlamını ve sohbet geçmişini kullanan transkripsiyon
Chrome Herhangi bir alana sesle yazmak için yakında geleceği belirtiliyor

macOS açıklaması, bu set içindeki en çok yapay zeka ajanı benzeri olanıdır. Google, modelin "yerel dosyaları özetlemeyi, uygulamalar arasında metinleri yeniden amaçlandırmayı veya doğrudan imlecinizin bulunduğu yerde görüntüler oluşturmayı" zahmetsiz hale getirdiğini söylüyor. Tüm bunlar yalnızca sesle çalışıyor.

LangChain, LiveKit, Pipecat ve Vercel dahil olmak üzere birçok geliştirici platformunun Live API üzerinde geliştirme yaptığı belirtiliyor.

Gözden kaçması kolay bir erişim notu: İki API yolunun ayrı model kimlikleri ve ayrı giriş noktaları vardır. Bu nedenle, canlı altyazı entegrasyonu ile toplantı arşivi entegrasyonu tek bir entegrasyon değil, iki ayrı entegrasyondur.

Duyurunun kapsamadığı konular

Burası, bir transkriptin artık yeterli olmadığı noktadır ve aradaki boşluğu tahmin etmek yerine açıkça belirtmekte fayda vardır.

Duyuru sayfasında metin çıktısı açıklanıyor. Sesten bir elektronik tablo, grafik, sunum veya yazılı rapor oluşturulması açıklanmıyor. Elektronik tablo, Excel, CSV, slayt, sunum, rapor ve gösterge paneli kelimeleri sayfada hiçbir yerde geçmiyor.

Açıklanan şey ise yetkilendirmedir: model, dosya analizini ve görüntü oluşturmayı diğer Gemini modellerine devreder. Yani teslim edilecek nihai ürün başka bir yerde, başka bir şey tarafından bir araya getirilir.

Bu makul bir tasarımdır. Aynı zamanda iyi bir transkriptin bir toplantı sürecini tek başına tamamlayamamasının da nedenidir.

Bir transkripti gönderilebilir bir belgeye dönüştürmek

Bir transkript ne konuşulduğunu kaydeder. Bir toplantı kaydının genellikle üç şeye daha ihtiyacı vardır: ekrandaki sayılar, alınan kararlar ve bundan sonra kimin neyi üstleneceği.

Powerdrill Bloom bu ikinci yarıda devreye girer. Sesi ve toplantının asıl konusu olan dosyayı yüklersiniz, ardından ondan ne elde etmek istediğinizi doğal dille tarif edersiniz.

Sesten metne (speech to text) sayfası .mp3, .mp4, .m4a, .webm ve diğer birkaç formatta ses yüklemelerini listeliyor. Özelliğin "sesinizden saniyeler içinde transkriptler, özetler ve ana noktalar elde ettiğini" belirtiyor.

Diğer yöndeki sınır konusunda adil olmak gerekirse: bu sayfa konuşmacı atamasını, kelime düzeyinde zaman damgalarını veya gerçek zamanlı akışı açıklamaz. Bunlar tam olarak Google'ın sunduğu özelliklerdir. Üç kişilik bir aramadan konuşmacılara göre ayrılmış, zaman damgalı bir çıktıya ihtiyacınız varsa, yeni model bu adım için daha iyi bir araçtır.

İkisinin çakışmayı bıraktığı yer ise ortaya çıkan üründür. Yapay zeka rapor oluşturucu (AI report generator) sayfası, kaynak dosyaların yazılı bir rapora dönüştürülmesini kapsar ve Office belgesi çıktısı Pro planında listelenmiştir.

Bilmeye değer alternatifler

Amacınız sesli arayüzlerden ziyade toplantı kayıtları ise üç farklı yol daha mevcuttur.

Toplantı platformunuzun kendi özeti. Microsoft Teams, kaydedilen her etkinlikten sonra kaydı, paylaşılan dosyaları, notları, gündemi ve takip görevlerini tek bir yerde toplar. Akıllı özet özellikleri Teams Premium veya bir Copilot lisansı gerektirir.

Özel bir not alıcı. Bunlar aramaya katılır, bir özet çıkarır ve kaydı kendi ürünlerinin içinde tutar. Toplantının kendisi asıl çıktı olduğunda kullanışlıdır.

Metin çıktısı artı kaynak dosyanız. Kurulumu daha yavaştır, ancak rapordaki sayıların birinin onları yüksek sesle okumasından değil, doğrudan dışa aktarımdan geldiği tek yoldur.

Hangisinin uygun olduğu tek bir soruya bağlıdır: Toplantının değerli kısmı insanların ne söylediği miydi, yoksa verilerin ne gösterdiği mi? İlk üç yol ilki için oldukça uygundur. Yalnızca son yol ikincisine hizmet eder.

Transkriptten teslim edilebilir ürüne

Gemini 3.5 Transcribe, dar kapsamlı bir problemde atılmış gerçek bir adımdır. Daha temiz metin, üç konuşmacı ataması, kelime düzeyinde zaman damgaları ve 85'ten fazla dil, eskiden her kayıttan sonra yapılması gereken düzenlemeleri azaltıyor.

Yapmadığı şey ise toplantının ne ürettiğine karar vermektir. Bu hala tartışmanın arkasındaki verilerden gelir, bu yüzden transkript ve kaynak dosya aynı yerde bulunmalıdır.

Gemini Deep Research ile karşılaştırmamız aynı sorunun araştırma boyutunu ele alıyor. Bir kaydı ve kaynak dosyasını tamamlanmış bir özete dönüştürmek için Powerdrill Bloom'u deneyin.

Buradaki bilgiler, Google'ın duyuru sayfasından alınan 31 Ağustos 2026 tarihi itibarıyla geçerli olan gerçeklerdir.

Sıkça sorulan sorular

Gemini 3.5 Transcribe nedir?

Google'ın 26 Ağustos 2026'da duyurduğu sesten metne modelidir. Google bunu, ham sesi pürüzsüz ve biçimlendirilmiş metne dönüştüren, şimdiye kadarki en hassas sesten metne modeli olarak tanımlıyor.

Gemini 3.5 Transcribe ne kadar doğru?

Google, Artificial Analysis tarafından ölçüldüğü üzere, akış için %4.0 ve akış dışı kullanım senaryoları için %2.6'lık bir ortalama Kelime Hata Oranı yayınlıyor. FLEURS kıyaslamasında bu rakamlar %5.50 ve %5.04'tür.

Kaç konuşmacıyı tanımlayabiliyor?

Önceden kaydedilmiş seslerde zaman damgalarıyla birlikte üç konuşmacıya kadar tanımlayabilir. Google, üçten fazla konuşmacı için desteği deneysel olarak tanımlıyor.

Gemini 3.5 Transcribe'a nasıl erişebilirim?

Google AI Studio'daki Gemini API ve Gemini Enterprise Agent Platform aracılığıyla erişebilirsiniz. Ayrıca Android'de Gboard, macOS'te Gemini uygulaması ve Google Antigravity'deki ses özelliklerine güç verirken, Chrome için de yakında geleceği belirtiliyor.

Toplantı özetini benim için yazar mı?

Duyuruda, tamamlanmış belgelerden ziyade transkripsiyon ve diğer Gemini modellerine yetkilendirme açıklanıyor. Temel rakamları içeren yazılı bir kayıt oluşturmak ayrı bir adımdır ve sesin yanı sıra kaynak dosyaya da ihtiyaç duyar.