Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe: मीटिंग ट्रांसक्रिप्ट, एक्सेस और विकल्प (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe: मीटिंग ट्रांसक्रिप्ट, एक्सेस और विकल्प (2026)

Google ने 26 अगस्त, 2026 को Gemini 3.5 Transcribe पेश किया। यह एक स्पीच-टू-टेक्स्ट मॉडल है जो रॉ ऑडियो को फॉर्मेटेड टेक्स्ट में बदलता है, जिसमें पहले से रिकॉर्ड की गई फाइलों पर स्पीकर एट्रिब्यूशन और वर्ड-लेवल टाइमस्टैम्प की सुविधा मिलती है। इस गाइड में बताया गया है कि क्या लॉन्च किया गया है, आप इसका उपयोग कहाँ कर सकते हैं, और किसी ट्रांसक्रिप्ट को भेजने योग्य दस्तावेज़ में बदलने के लिए अभी और क्या किया जाना बाकी है।

Google ने 26 अगस्त को क्या घोषणा की

यह घोषणा संक्षिप्त और विशिष्ट है। Google इसे "हमारा अब तक का सबसे सटीक स्पीच-टू-टेक्स्ट मॉडल कहता है, जिसे इंटेलिजेंट वॉयस इंटरैक्शन के लिए डिज़ाइन किया गया है।"

इसकी रूपरेखा पुराने स्पीच रिकग्निशन से बिल्कुल अलग है। Google की घोषणा के अनुसार, पारंपरिक मॉडलों को "बैकग्राउंड नॉइज़, जटिल शब्दावली और हकलाहट या रुकावटों (disfluency) को साफ करने में कठिनाई होती है।" Google का कहना है कि यह मॉडल "रॉ ऑडियो को सीधे सटीक, परिष्कृत और फॉर्मेटेड टेक्स्ट में बदल देता है।"

सटीकता के दो आंकड़े प्रकाशित किए गए हैं। Artificial Analysis द्वारा किए गए माप के अनुसार, यह मॉडल स्ट्रीमिंग के लिए 4.0% और नॉन-स्ट्रीमिंग उपयोग के मामलों के लिए 2.6% की औसत वर्ड एरर रेट (Word Error Rate) तक पहुंचता है।

Google इसकी तुलना Chirp 3 से भी करता है, जो कि वह मॉडल है जिसका उपयोग वह पहले करता था। अंतिम आउटपुट मिलने का समय "70% बेहतर हो जाता है," और FLEURS बेंचमार्क पर यह स्ट्रीमिंग में 5.50% WER और नॉन-स्ट्रीमिंग में 5.04% दर्ज करता है।

उन आंकड़ों से कहीं अधिक महत्वपूर्ण परिणाम का फॉर्मेट है। एक साफ-सुथरी रॉ टेक्स्ट फ़ाइल का मतलब है कि किसी के भी उपयोग करने से पहले उसमें कम संपादन करना पड़ेगा।

मॉडल को पेश करने के दो तरीके

इसके दो अलग-अलग API हैं, और यदि मीटिंग्स आपका मुख्य उपयोग का मामला है, तो यह विभाजन काफी मायने रखता है।

मोड मॉडल ID इसे किस लिए बनाया गया है
रियल-टाइम स्ट्रीमिंग gemini-3.5-transcribe-live Live API के माध्यम से सब-सेकंड लेटेंसी के साथ निरंतर द्विदिश (bidirectional) स्ट्रीमिंग
पहले से रिकॉर्ड किया गया ऑडियो gemini-3.5-transcribe Interactions API के माध्यम से रिकॉर्ड किया गया ऑडियो, मीटिंग्स और कॉल लॉग्स

पहले से रिकॉर्ड किया गया पाथ वह है जिसमें मीटिंग फीचर्स शामिल हैं। Google इसे "स्पीकर एट्रिब्यूशन और वर्ड-लेवल टाइमस्टैम्प के साथ रिकॉर्ड किए गए ऑडियो, मीटिंग्स, कॉल लॉग्स और बहुत कुछ" को ट्रांसक्राइब करने के रूप में वर्णित करता है।

स्पीकर सपोर्ट की एक घोषित सीमा है। यह मॉडल "पहले से रिकॉर्ड किए गए ऑडियो में अधिकतम तीन स्पीकर्स के लिए टाइमस्टैम्प के साथ बातचीत को सटीक रूप से एट्रिब्यूट करता है," और तीन से अधिक स्पीकर्स के लिए सपोर्ट को प्रयोगात्मक बताया गया है.

स्मार्ट ट्रांसक्रिप्शन वास्तव में क्या बदलता है

चार क्षमताओं को सूचीबद्ध किया गया है, और वे एक साधारण ट्रांसक्रिप्ट से व्यावहारिक अंतर पैदा करती हैं।

डिसफ्लुएंसी क्लीनअप। यह मॉडल खुद किए जाने वाले सुधारों जैसे कि "चलो मंगलवार को मिलते हैं—नहीं, बुधवार को" को संभालता है, फिलर शब्दों को हटाता है, और आउटपुट को ऑटो-फॉर्मेट करता है।

कस्टम वोकैबुलरी। आप अपने खुद के शब्द प्रदान कर सकते हैं ताकि विशेष तकनीकी शब्दावली और असामान्य वर्तनी इस प्रक्रिया में सुरक्षित रहें।

अल्फ़ान्यूमेरिक सटीकता। Google विशेष रूप से "पोस्टल कोड और ऑर्डर ID जैसी अल्फ़ान्यूमेरिक एंटिटीज" को रेखांकित करता है, जहाँ सामान्य मॉडल अक्सर विफल हो जाते हैं।

भाषा कवरेज। यह मॉडल क्षेत्रीय लहजों और बोलियों सहित 85 से अधिक भाषाओं का स्वचालित रूप से पता लगाता है।

ध्यान देने योग्य एक फ़ंक्शन-कॉलिंग क्षमता भी है। Google का कहना है कि यह मॉडल "फ़ंक्शन कॉल के माध्यम से अन्य Gemini मॉडलों को जटिल कार्य (जैसे इमेज जनरेशन और फ़ाइल विश्लेषण) सौंप सकता है।" यह क्षमता वर्तमान में केवल Gemini macOS ऐप के लिए सूचीबद्ध है।

आप आज इसका उपयोग कहाँ कर सकते हैं

यह केवल-API रिलीज़ नहीं है, जो किसी मॉडल लॉन्च के लिए असामान्य है।

प्लेटफॉर्म यह वहाँ क्या करता है
Google AI Studio में Gemini API बिल्ड मोड, जिसमें आवाज के जरिए ऐप्स की कोडिंग करना शामिल है
Gemini Enterprise Agent Platform वही मॉडल, एंटरप्राइज डिप्लॉयमेंट पाथ
Android पर Gboard Rambler फीचर आवाज को फॉर्मेटेड टेक्स्ट में बदलता है
macOS पर Gemini ऐप स्क्रीन संदर्भ के साथ जुड़े वॉयस कमांड
Google Antigravity ट्रांसक्रिप्शन जो स्क्रीन संदर्भ और चैट इतिहास का उपयोग करता है
Chrome जल्द ही आने वाले के रूप में वर्णित, किसी भी फ़ील्ड में आवाज़ द्वारा टाइप करने के लिए

macOS का विवरण इस सेट में सबसे अधिक एजेंट-जैसा है। Google का कहना है कि यह मॉडल "लोकल फाइलों को संक्षेप में प्रस्तुत करना, ऐप्स के बीच टेक्स्ट का पुनरुत्पादन करना, या सीधे आपके कर्सर पर इमेज जेनरेट करना" बेहद आसान बनाता है। यह सब केवल आवाज़ से चलता है।

कई डेवलपर प्लेटफॉर्मों को Live API पर निर्माण करने वाले के रूप में नामित किया गया है, जिनमें LangChain, LiveKit, Pipecat और Vercel शामिल हैं।

एक्सेस से जुड़ी एक बात आसानी से छूट सकती है। दोनों API पाथ के अलग-अलग मॉडल ID और अलग-अलग एंट्री पॉइंट हैं। इसलिए एक लाइव कैप्शनिंग बिल्ड और एक मीटिंग-आर्काइव बिल्ड दो अलग-अलग इंटीग्रेशन हैं, न कि एक।

घोषणा में क्या शामिल नहीं है

यह वह जगह है जहाँ केवल एक ट्रांसक्रिप्ट पर्याप्त नहीं रह जाती है, और इस अंतर को अनुमान लगाने के बजाय स्पष्ट रूप से बताना बेहतर है।

घोषणा पृष्ठ टेक्स्ट आउटपुट का वर्णन करता है। यह ऑडियो से स्प्रेडशीट, चार्ट, डेक या लिखित रिपोर्ट तैयार करने का वर्णन नहीं करता है। इसमें spreadsheet, Excel, CSV, slide, deck, report और dashboard जैसे शब्द कहीं भी दिखाई नहीं देते हैं।

यह जिस चीज़ का वर्णन करता है वह है डेलिगेशन: मॉडल फ़ाइल विश्लेषण और इमेज जनरेशन का काम अन्य Gemini मॉडलों को सौंप देता है। इसलिए अंतिम परिणाम कहीं और, किसी अन्य चीज़ द्वारा तैयार किया जाता है।

यह एक उचित डिज़ाइन है। यही कारण भी है कि एक अच्छी ट्रांसक्रिप्ट किसी मीटिंग के पूरे चक्र को पूरा नहीं करती है।

ट्रांसक्रिप्ट को किसी ऐसी चीज़ में बदलना जिसे आप भेज सकें

एक ट्रांसक्रिप्ट रिकॉर्ड करती है कि क्या कहा गया था। एक मीटिंग रिकॉर्ड को आमतौर पर तीन और चीज़ों की आवश्यकता होती है: स्क्रीन पर मौजूद आंकड़े, निर्णय, और आगे किसे क्या काम करना है।

Powerdrill Bloom इसी दूसरे हिस्से पर काम करता है। आप ऑडियो और उस फ़ाइल को अपलोड करते हैं जिसके बारे में वास्तव में मीटिंग थी, और फिर सरल भाषा में बताते हैं कि आप इससे क्या परिणाम चाहते हैं।

The speech to text पेज .mp3, .mp4, .m4a, .webm और कई अन्य फॉर्मेट में ऑडियो अपलोड को सूचीबद्ध करता है। यह कहता है कि यह फीचर "सेकंडों में आपके ऑडियो से ट्रांसक्रिप्ट, सारांश और मुख्य बिंदु प्राप्त कर लेता है।"

दूसरी दिशा में सीमा के बारे में निष्पक्ष रहें तो: वह पेज स्पीकर एट्रिब्यूशन, वर्ड-लेवल टाइमस्टैम्प या रियल-टाइम स्ट्रीमिंग का वर्णन नहीं करता है। Google ने ठीक यही चीजें लॉन्च की हैं। यदि आपको तीन लोगों की कॉल से डायराइज्ड, टाइमस्टैम्प वाला आउटपुट चाहिए, तो उस चरण के लिए नया मॉडल बेहतर टूल है।

जहाँ ये दोनों एक-दूसरे से अलग होते हैं, वह है अंतिम परिणाम। AI report generator पेज सोर्स फाइलों को एक लिखित रिपोर्ट में बदलने की सुविधा प्रदान करता है, और Pro प्लान पर Office डॉक्यूमेंट आउटपुट सूचीबद्ध है।

जानने योग्य विकल्प

यदि आपका लक्ष्य वॉयस इंटरफेस के बजाय मीटिंग रिकॉर्ड प्राप्त करना है, तो तीन अन्य रास्ते मौजूद हैं.

आपके मीटिंग प्लेटफॉर्म का अपना रीकैप। Microsoft Teams किसी भी रिकॉर्ड किए गए इवेंट के बाद रिकॉर्डिंग, साझा की गई फाइलें, नोट्स, एजेंडा और फॉलो-अप कार्यों को एक ही स्थान पर एकत्र करता है। इंटेलिजेंट रीकैप फीचर्स के लिए Teams Premium या Copilot लाइसेंस की आवश्यकता होती है।

एक समर्पित नोटटेकर। ये कॉल में शामिल होते हैं, सारांश तैयार करते हैं, और रिकॉर्ड को अपने स्वयं के प्रोडक्ट के भीतर रखते हैं। यह तब अच्छा होता है जब मीटिंग खुद ही मुख्य परिणाम हो।

टेक्स्ट आउटपुट और आपकी सोर्स फ़ाइल। इसे सेटअप करने में अधिक समय लगता है, लेकिन यह एकमात्र ऐसा रास्ता है जहाँ रिपोर्ट में दिए गए आंकड़े किसी के द्वारा उन्हें जोर से पढ़ने के बजाय सीधे एक्सपोर्ट से आते हैं।

कौन सा विकल्प उपयुक्त है यह एक ही सवाल पर निर्भर करता है: मीटिंग का मूल्यवान हिस्सा वह था जो लोगों ने कहा, या वह जो डेटा ने दिखाया? पहले तीन रास्ते पूर्ववर्ती के लिए अच्छे हैं। केवल आखिरी रास्ता उत्तरवर्ती के काम आता है।

ट्रांसक्रिप्ट से अंतिम परिणाम तक

Gemini 3.5 Transcribe एक विशिष्ट समस्या को हल करने की दिशा में एक वास्तविक कदम है। साफ-सुथरा टेक्स्ट, तीन-स्पीकर एट्रिब्यूशन, वर्ड-लेवल टाइमस्टैम्प और 85 से अधिक भाषाएं, ये सभी उस संपादन को कम करते हैं जो पहले हर रिकॉर्डिंग के बाद करना पड़ता था।

यह जो काम नहीं करता है वह यह तय करना है कि मीटिंग से क्या परिणाम निकला। वह अभी भी चर्चा के पीछे के डेटा से आता है, यही कारण है कि ट्रांसक्रिप्ट और सोर्स फ़ाइल का एक ही स्थान पर होना आवश्यक है।

Our comparison with Gemini Deep Research इसी प्रश्न के शोध पक्ष को कवर करती है। एक रिकॉर्डिंग और उसकी सोर्स फ़ाइल को एक तैयार सारांश में बदलने के लिए, Powerdrill Bloom आज़माएं

यहाँ दिए गए तथ्य 31 अगस्त, 2026 तक के हैं, जो Google के घोषणा पृष्ठ से लिए गए हैं।

अक्सर पूछे जाने वाले प्रश्न

Gemini 3.5 Transcribe क्या है?

यह Google का स्पीच-टू-टेक्स्ट मॉडल है जिसकी घोषणा 26 अगस्त, 2026 को की गई थी। Google इसे अपने अब तक के सबसे सटीक स्पीच-टू-टेक्स्ट मॉडल के रूप में वर्णित करता है, जो रॉ ऑडियो को परिष्कृत, फॉर्मेटेड टेक्स्ट में बदलता है।

Gemini 3.5 Transcribe कितना सटीक है?

Google, Artificial Analysis द्वारा मापे गए अनुसार, स्ट्रीमिंग के लिए 4.0% और नॉन-स्ट्रीमिंग उपयोग के मामलों के लिए 2.6% की औसत वर्ड एरर रेट प्रकाशित करता है। FLEURS बेंचमार्क पर ये आंकड़े 5.50% और 5.04% हैं।

यह कितने स्पीकर्स की पहचान कर सकता है?

पहले से रिकॉर्ड किए गए ऑडियो में टाइमस्टैम्प के साथ अधिकतम तीन स्पीकर्स तक। Google तीन से अधिक स्पीकर्स के लिए सपोर्ट को प्रयोगात्मक बताता है।

मैं Gemini 3.5 Transcribe तक कैसे पहुँच सकता हूँ?

Google AI Studio में Gemini API और Gemini Enterprise Agent Platform के माध्यम से। यह Android पर Gboard, macOS पर Gemini ऐप और Google Antigravity में वॉयस फीचर्स को भी संचालित करता है, और Chrome को जल्द ही आने वाले के रूप में वर्णित किया गया है।

क्या यह मेरे लिए मीटिंग का सारांश लिखता है?

घोषणा में तैयार दस्तावेजों के बजाय ट्रांसक्रिप्शन और अन्य Gemini मॉडलों को काम सौंपने का वर्णन किया गया है। अंतर्निहित आंकड़ों के साथ एक लिखित रिकॉर्ड तैयार करना एक अलग चरण है, और इसके लिए ऑडियो के साथ-साथ सोर्स फ़ाइल की भी आवश्यकता होती है।