Gemini 3.5 Transcribe:会议转录、访问途径与替代方案 (2026)

Google 于 2026 年 8 月 26 日推出了 Gemini 3.5 Transcribe。这是一款语音转文本模型,可将原始音频转换为格式化的文本,并对预录制文件提供发言人识别和字级时间戳。本指南将介绍发布的内容、适用场景,以及在将转录文本发送出去之前还需要进行哪些处理。
Google 在 8 月 26 日发布了什么
此次发布的内容简短而具体。Google 将其称为“我们迄今为止最精准的语音转文本模型,专为智能语音交互而设计。”
这一定位与传统的语音识别形成了鲜明对比。根据 Google 的官方公告,传统模型“在应对背景噪音、复杂专业术语以及口吃和语气词清理时非常吃力”。而 Google 表示,这款新模型“可以直接将原始音频转换为准确、精简且格式化的文本”。
官方公布了两个准确率数据。经 Artificial Analysis 评估,该模型在流式传输用例中的平均字错率为 4.0%,在非流式传输用例中为 2.6%。
Google 还将其与此前使用的 Chirp 3 模型进行了对比。最终输出时间“缩短了 70%”,在 FLEURS 基准测试中,流式传输的字错率为 5.50%,非流式传输为 5.04%。
相比这些数字,输出结果的格式更为关键。更干净的原始文本文件意味着在投入使用前需要进行的编辑工作更少。
该模型提供的两种方式
该模型提供两个独立的 API,如果您主要用于会议场景,这两者的区别至关重要。
| 模式 | 模型 ID | 适用场景 |
|---|---|---|
| 实时流式传输 | gemini-3.5-transcribe-live |
通过 Live API 实现亚秒级延迟的持续双向流式传输 |
| 预录制音频 | gemini-3.5-transcribe |
通过 Interactions API 处理录音、会议和通话记录 |
预录制路径是支持会议功能的方式。Google 将其描述为“对录音、会议、通话记录等进行转录,并提供发言人识别和字级时间戳”。
发言人识别支持存在明确的上限。该模型“能够准确识别预录制音频中最多三位发言人的语音并标注时间戳”,超过三位发言人的支持目前被描述为实验性功能。
智能转录究竟改变了什么
官方列出了四项核心能力,这也是它与普通转录文本的实际区别所在。
口吃和语气词清理。模型可以处理自我纠正(例如“我们周二见面——不,周三”),去除无意义的填充词,并自动格式化输出。
自定义词汇表。您可以提供自己的专属词汇,以便在转录过程中准确保留专业术语和不常用的拼写。
字母数字准确性。Google 特别强调了“邮政编码和订单 ID 等字母数字实体”,而这正是通用模型通常容易出错的地方。
语言覆盖范围。该模型可自动检测 85 多种语言,包括地方口音和方言。
还有一个值得注意的函数调用功能。Google 表示,该模型“可以通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型”。目前,该功能仅列在 Gemini macOS 应用中。
您今天可以在哪里使用它
这不仅仅是一个仅面向 API 的发布,这在模型发布中并不常见。
| 平台/界面 | 具体功能 |
|---|---|
| Google AI Studio 中的 Gemini API | 构建模式,包括通过语音编写应用程序代码 |
| Gemini Enterprise Agent Platform | 相同的模型,企业级部署路径 |
| Android 上的 Gboard | Rambler 功能可将语音转换为格式化文本 |
| macOS 上的 Gemini 应用 | 结合屏幕上下文的语音命令 |
| Google Antigravity | 结合屏幕上下文和聊天记录进行转录 |
| Chrome | 官方称即将推出,用于在任何输入框中进行语音输入 |
在这一系列应用中,macOS 上的描述最具有智能体特征。Google 表示,该模型让“总结本地文件、跨应用重用文本或直接在光标处生成图像”变得毫不费力。而这一切仅凭语音即可运行。
官方点名了几家基于 Live API 进行构建的开发者平台,包括 LangChain、LiveKit、Pipecat 和 Vercel。
有一个关于接入的注意事项很容易被忽略。这两个 API 路径拥有独立的模型 ID 和不同的入口。因此,构建实时字幕和构建会议存档是两个独立的集成项目,而不是一个。
公告中未涵盖的内容
这正是仅靠转录文本还远远不够的地方,这个差距值得坦率地指出,而不是凭空猜测。
公告页面描述的是文本输出。它并没有描述如何从音频中生成电子表格、图表、幻灯片或书面报告。在公告中,spreadsheet、Excel、CSV、slide、deck、report 和 dashboard 这些词根本没有出现。
它所描述的是委派:该模型将文件分析和图像生成交由其他 Gemini 模型处理。因此,最终的交付物是在其他地方由其他工具组装而成的。
这是一个合理的设计。但这也是为什么一份优秀的转录文本并不能完成会议闭环的原因。
将转录文本转化为可发送的交付物
转录文本记录了发言内容。但一份会议记录通常还需要另外三样东西:屏幕上显示的数据、做出的决策,以及后续工作的负责人。
Powerdrill Bloom 正是专注于这后半部分的工作。您上传音频以及会议实际针对的文件,然后用自然语言描述您想要从中获取什么内容。
其语音转文本页面列出了支持上传的音频格式,包括 .mp3、.mp4、.m4a、.webm 等多种格式。页面介绍称,该功能“可在数秒内从您的音频中获取转录文本、摘要和要点”。
客观地来看另一个方向的界限:该页面并未描述发言人识别、字级时间戳或实时流式传输。而这些恰恰是 Google 所发布的核心功能。如果您需要对三人通话进行角色标注和带时间戳的输出,那么 Google 的新模型在这一步是更好的工具。
两者不再重合的地方在于最终交付物。其AI 报告生成器页面涵盖了将源文件转化为书面报告的功能,并且 Pro 计划中列出了支持输出 Office 文档。
值得了解的其他替代方案
如果您的目标是获取会议记录而非构建语音交互界面,还有另外三种途径。
会议平台自带的回顾功能。在任何录制的会议结束后,Microsoft Teams 会将录音、共享文件、笔记、议程和后续任务统一收集到一个地方。智能回顾功能需要 Teams Premium 或 Copilot 许可证。
专用的会议记录工具。这些工具会加入通话,生成摘要,并将记录保存在其自身的产品中。当会议本身就是最终交付物时,这种方式非常适用。
文本输出加上您的源文件。这种方式设置起来较慢,但它是唯一能确保撰写报告中的数据直接来自导出文件,而不是来自某人朗读的途径。
哪种方案最合适取决于一个核心问题:会议中最有价值的部分是人们说了什么,还是数据展示了什么?前三种途径能很好地服务于前者。而只有最后一种途径能服务于后者。
从转录文本到最终交付物
Gemini 3.5 Transcribe 在解决特定领域的问题上迈出了切实的一步。更干净的文本、三人发言人识别、字级时间戳以及 85 多种语言支持,都减少了以往每次录音后所需的编辑工作。
但它无法决定会议产出了什么。这仍然取决于讨论背后的数据,这也是为什么转录文本和源文件应该放在同一个地方的原因。
我们与 Gemini Deep Research 的对比涵盖了同一问题的研究层面。要将录音及其源文件转化为完整的摘要,请尝试使用 Powerdrill Bloom。
此处的信息截至 2026 年 8 月 31 日,来源于 Google 的官方公告页面。
常见问题解答
什么是 Gemini 3.5 Transcribe?
这是 Google 于 2026 年 8 月 26 日发布的语音转文本模型。Google 将其描述为迄今为止最精准的语音转文本模型,可将原始音频转换为精简且格式化的文本。
Gemini 3.5 Transcribe 的准确率如何?
根据 Artificial Analysis 的评估,Google 公布的流式传输平均字错率为 4.0%,非流式传输用例为 2.6%。在 FLEURS 基准测试中,这两个数字分别为 5.50% 和 5.04%。
它能识别多少位发言人?
在预录制音频中最多可识别三位发言人,并带有时间戳。Google 将对三位以上发言人的支持描述为 experimental。
如何获取 Gemini 3.5 Transcribe?
可通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 进行访问。它还为 Android 上的 Gboard、macOS 上的 Gemini 应用以及 Google Antigravity 中的语音功能提供支持,官方称 Chrome 支持也即将推出。
它会帮我撰写会议摘要吗?
官方公告描述的是转录以及向其他 Gemini 模型进行任务委派,而非直接生成完整的文档。要生成包含底层数据的书面记录是一个单独的步骤,这不仅需要音频,还需要源文件。