Gemini 3.5 Transcribe: Transkrip Rapat, Akses, dan Alternatif (2026)

Google memperkenalkan Gemini 3.5 Transcribe pada 26 Agustus 2026. Ini adalah model speech-to-text yang mengubah audio mentah menjadi teks terformat, lengkap dengan atribusi pembicara dan stempel waktu tingkat kata pada file rekaman. Panduan ini membahas apa saja yang diluncurkan, di mana Anda dapat menggunakannya, dan apa saja yang masih harus dilakukan sebelum transkrip menjadi sesuatu yang siap Anda kirim.
Apa yang diumumkan Google pada 26 Agustus
Pengumuman tersebut singkat dan spesifik. Google menyebutnya sebagai "model speech-to-text kami yang paling presisi hingga saat ini, dirancang untuk interaksi suara yang cerdas."
Pendekatan ini sangat kontras dengan pengenalan suara versi lama. Menurut pengumuman Google, model konvensional "kesulitan dengan kebisingan latar belakang, jargon yang rumit, dan pembersihan ketidaklancaran bicara." Model yang satu ini, menurut Google, "mengubah audio mentah secara langsung menjadi teks yang akurat, rapi, dan terformat."
Dua angka akurasi telah dipublikasikan. Berdasarkan pengukuran oleh Artificial Analysis, model ini mencapai rata-rata Word Error Rate sebesar 4.0% untuk streaming dan 2.6% untuk penggunaan non-streaming.
Google juga membandingkannya dengan Chirp 3, model yang digunakan sebelumnya. Waktu untuk menghasilkan output akhir "meningkat sebesar 70%," dan pada tolok ukur FLEURS, model ini mencatat WER sebesar 5.50% untuk streaming dan 5.04% untuk non-streaming.
Angka-angka tersebut tidak lebih penting daripada format hasil akhirnya. File teks mentah yang lebih bersih berarti lebih sedikit pengeditan yang diperlukan sebelum siap digunakan.
Dua cara model ini ditawarkan
Terdapat dua API terpisah, dan pembagian ini sangat penting jika kebutuhan Anda adalah untuk rapat.
| Mode | Model ID | Tujuan pembuatan |
|---|---|---|
| Streaming waktu nyata (real-time) | gemini-3.5-transcribe-live |
Streaming dua arah berkelanjutan dengan latensi di bawah satu detik, melalui Live API |
| Audio rekaman | gemini-3.5-transcribe |
Audio rekaman, rapat, dan log panggilan, melalui Interactions API |
Jalur audio rekaman adalah jalur yang menyediakan fitur-fitur rapat. Google menjelaskannya sebagai kemampuan mentranskripsi "audio rekaman, rapat, log panggilan, dan lainnya dengan atribusi pembicara serta stempel waktu tingkat kata."
Dukungan pembicara memiliki batas maksimal yang ditentukan. Model ini "secara akurat mengatribusikan ucapan dalam audio rekaman dengan stempel waktu hingga tiga pembicara," dan dukungan untuk lebih dari tiga pembicara masih bersifat eksperimental.
Apa yang sebenarnya diubah oleh transkripsi cerdas
Ada empat kemampuan yang tercantum, dan ini merupakan perbedaan praktis dari transkrip biasa.
Pembersihan ketidaklancaran bicara. Model ini menangani koreksi mandiri seperti "mari kita bertemu hari Selasa—bukan, hari Rabu," menghapus kata-kata pengisi (filler words), dan memformat output secara otomatis.
Kosakata khusus. Anda dapat menyediakan istilah Anda sendiri sehingga jargon khusus dan ejaan yang tidak biasa tetap terjaga dalam prosesnya.
Akurasi alfanumerik. Google secara khusus menyoroti "entitas alfanumerik seperti kode pos dan ID pesanan," yang biasanya menjadi titik kegagalan model generik.
Cakupan bahasa. Model ini secara otomatis mendeteksi lebih dari 85 bahasa, termasuk aksen regional dan dialek.
Ada juga kemampuan pemanggilan fungsi (function-calling) yang patut dicatat. Google menyatakan bahwa model ini "dapat mendelegasikan tugas-tugas kompleks (seperti pembuatan gambar dan analisis file) ke model Gemini lainnya melalui pemanggilan fungsi." Kemampuan tersebut saat ini hanya terdaftar untuk aplikasi Gemini macOS.
Di mana Anda dapat menggunakannya saat ini
Ini bukan rilis yang hanya ditujukan untuk API, sesuatu yang tidak biasa untuk peluncuran sebuah model.
| Platform | Fungsinya di sana |
|---|---|
| Gemini API di Google AI Studio | Mode pembuatan, termasuk membuat kode aplikasi menggunakan suara |
| Gemini Enterprise Agent Platform | Model yang sama, jalur penerapan untuk perusahaan (enterprise) |
| Gboard di Android | Fitur Rambler mengubah ucapan menjadi teks terformat |
| Aplikasi Gemini di macOS | Perintah suara yang dipadukan dengan konteks layar |
| Google Antigravity | Transkripsi yang menggunakan konteks layar dan riwayat obrolan |
| Chrome | Disebutkan akan segera hadir, untuk mengetik menggunakan suara di kolom apa pun |
Deskripsi macOS adalah yang paling menyerupai agen dari semuanya. Google menyatakan bahwa model ini memudahkan Anda "untuk merangkum file lokal, menggunakan kembali teks di berbagai aplikasi, atau menghasilkan gambar langsung di posisi kursor Anda." Semua itu berjalan hanya dengan perintah suara.
Beberapa platform pengembang disebut-sebut sedang membangun di atas Live API, termasuk LangChain, LiveKit, Pipecat, dan Vercel.
Satu catatan akses yang mudah terlewatkan adalah kedua jalur API memiliki ID model dan titik masuk yang terpisah. Oleh karena itu, pembuatan teks takar langsung (live captioning) dan pembuatan arsip rapat adalah dua integrasi yang berbeda, bukan satu.
Apa yang tidak dicakup dalam pengumuman tersebut
Di sinilah transkrip saja tidak lagi cukup, dan kesenjangan ini perlu dinyatakan secara jelas daripada sekadar ditebak.
Halaman pengumuman tersebut menjelaskan output teks. Halaman itu tidak menjelaskan tentang pembuatan spreadsheet, bagan, dek presentasi, atau laporan tertulis dari audio tersebut. Kata-kata spreadsheet, Excel, CSV, slide, deck, report, dan dashboard sama sekali tidak muncul di sana.
Yang dijelaskannya adalah pendelegasian: model ini menyerahkan analisis file dan pembuatan gambar ke model Gemini lainnya. Jadi, hasil akhir yang dapat dikirimkan dirakit di tempat lain, oleh sistem lain.
Itu adalah desain yang masuk akal. Hal itu juga menjadi alasan mengapa transkrip yang bagus tidak serta-merta menyelesaikan seluruh tindak lanjut dari sebuah rapat.
Mengubah transkrip menjadi sesuatu yang siap Anda kirim
Transkrip mencatat apa yang diucapkan. Catatan rapat biasanya membutuhkan tiga hal lagi: angka-angka yang ada di layar, keputusan yang diambil, dan siapa yang bertanggung jawab atas langkah selanjutnya.
Powerdrill Bloom menangani bagian kedua tersebut. Anda mengunggah audio dan file yang sebenarnya dibahas dalam rapat, lalu menjelaskan dengan bahasa sehari-hari apa yang ingin Anda hasilkan dari dokumen tersebut.
Halaman speech to text mencantumkan unggahan audio dalam format .mp3, .mp4, .m4a, .webm, dan beberapa format lainnya. Halaman tersebut menyatakan bahwa fitur ini "mendapatkan transkrip, ringkasan, dan poin-poin utama dari audio Anda dalam hitungan detik."
Agar adil mengenai batasan di arah sebaliknya: halaman tersebut tidak menjelaskan tentang atribusi pembicara, stempel waktu tingkat kata, atau streaming waktu nyata. Hal-hal itulah yang justru diluncurkan oleh Google. Jika Anda memerlukan output terdiarisasi dan berstempel waktu dari panggilan tiga orang, model baru ini adalah alat yang lebih baik untuk langkah tersebut.
Titik di mana keduanya tidak lagi tumpang tindih adalah pada hasil akhirnya (artifact). Halaman AI report generator membahas tentang pengubahan file sumber menjadi laporan tertulis, dan output dokumen Office terdaftar dalam paket Pro.
Alternatif yang patut diketahui
Jika tujuan Anda adalah membuat catatan rapat alih-alih antarmuka suara, ada tiga jalur lain yang tersedia.
Rekap bawaan dari platform rapat Anda. Microsoft Teams mengumpulkan rekaman, file yang dibagikan, catatan, agenda, dan tugas tindak lanjut di satu tempat setelah acara yang direkam selesai. Fitur rekap cerdas memerlukan Teams Premium atau lisensi Copilot.
Pencatat khusus (dedicated notetaker). Alat ini ikut serta dalam panggilan, menghasilkan ringkasan, dan menyimpan catatan di dalam produk mereka sendiri. Sangat bagus jika rapat itu sendiri adalah hasil akhir yang diinginkan.
Output teks ditambah file sumber Anda. Lebih lambat untuk disiapkan, tetapi merupakan satu-satunya jalur di mana angka-angka dalam laporan tertulis berasal dari hasil ekspor langsung, bukan dari seseorang yang membacakannya dengan keras.
Mana yang paling cocok bergantung pada satu pertanyaan: apakah bagian paling berharga dari rapat tersebut adalah apa yang diucapkan orang-orang, atau apa yang ditunjukkan oleh data? Tiga jalur pertama melayani hal yang pertama dengan baik. Hanya jalur terakhir yang melayani hal yang kedua.
Dari transkrip ke hasil akhir yang dapat dikirimkan
Gemini 3.5 Transcribe adalah langkah nyata dalam mengatasi masalah yang spesifik. Teks yang lebih bersih, atribusi tiga pembicara, stempel waktu tingkat kata, dan lebih dari 85 bahasa, semuanya mengurangi proses pengeditan yang biasanya harus dilakukan setelah setiap perekaman.
Yang tidak dilakukannya adalah menentukan apa yang dihasilkan dari rapat tersebut. Hal itu tetap berasal dari data di balik diskusi, itulah sebabnya transkrip dan file sumber harus berada di tempat yang sama.
Perbandingan kami dengan Gemini Deep Research membahas sisi penelitian dari pertanyaan yang sama. Untuk mengubah rekaman dan file sumbernya menjadi ringkasan yang sudah jadi, coba Powerdrill Bloom.
Fakta-fakta di sini adalah per 31 Agustus 2026, bersumber dari halaman pengumuman Google.
Pertanyaan yang sering diajukan
Apa itu Gemini 3.5 Transcribe?
Ini adalah model speech-to-text dari Google yang diumumkan pada 26 Agustus 2026. Google menjelaskannya sebagai model speech-to-text yang paling presisi hingga saat ini, yang mengubah audio mentah menjadi teks yang rapi dan terformat.
Seberapa akurat Gemini 3.5 Transcribe?
Google mempublikasikan rata-rata Word Error Rate sebesar 4.0% untuk streaming dan 2.6% untuk penggunaan non-streaming, berdasarkan pengukuran oleh Artificial Analysis. Pada tolok ukur FLEURS, angkanya adalah 5.50% dan 5.04%.
Berapa banyak pembicara yang dapat diidentifikasinya?
Hingga tiga pembicara dalam audio rekaman, lengkap dengan stempel waktu. Google menjelaskan dukungan untuk lebih dari tiga pembicara masih bersifat eksperimental.
Bagaimana cara mengakses Gemini 3.5 Transcribe?
Melalui Gemini API di Google AI Studio dan Gemini Enterprise Agent Platform. Model ini juga mendukung fitur suara di Gboard pada Android, aplikasi Gemini di macOS, dan Google Antigravity, dengan Chrome yang disebutkan akan segera hadir.
Apakah model ini menulis ringkasan rapat untuk saya?
Pengumuman tersebut menjelaskan tentang transkripsi dan pendelegasian ke model Gemini lainnya, bukan tentang pembuatan dokumen yang sudah jadi. Menghasilkan catatan tertulis dengan angka-angka yang mendasarinya adalah langkah terpisah, dan memerlukan file sumber serta audionya.