Gemini 3.5 Transcribe: 会議の文字起こし、アクセス、および代替手段 (2026)

Googleは2026年8月26日にGemini 3.5 Transcribeを発表しました。これは、生の音声をフォーマットされたテキストに変換する音声文字起こしモデルであり、録音済みファイルにおける話者の特定や単語レベルのタイムスタンプ付与に対応しています。本ガイドでは、リリースされた機能、利用可能な場所、そして文字起こしデータをそのまま送信できる成果物にするために必要なプロセスについて解説します。
8月26日にGoogleが発表した内容
発表内容は簡潔で具体的です。Googleはこれを「インテリジェントな音声インタラクション向けに設計された、当社史上最も高精度な音声文字起こしモデル」と呼んでいます。
この位置づけは、従来の音声認識とは対照的です。Googleの発表によると、従来のモデルは「背景雑音、複雑な専門用語、言い淀みのクリーンアップに苦戦する」のに対し、今回のモデルは「生の音声を正確で洗練された、フォーマット済みのテキストに直接変換する」とGoogleは述べています。
2つの精度を示す数値が公開されています。Artificial Analysisによる測定では、このモデルはストリーミングで4.0%、非ストリーミングのユースケースで2.6%という平均単語誤り率(Word Error Rate)を達成しています。
Googleはまた、以前使用していたモデルであるChirp 3との比較も行っています。最終出力までの時間は「70%改善」され、FLEURSベンチマークではストリーミングで5.50%、非ストリーミングで5.04%のWERを記録しています。
これらの数値よりも重要なのは、出力結果のフォーマットです。生のテキストファイルがよりクリーンであれば、実用化する前の編集作業が少なくて済みます。
モデルが提供される2つの方法
2つの独立したAPIが存在し、会議での利用を想定している場合、この区分が重要になります。
| モード | モデルID | 設計目的 |
|---|---|---|
| リアルタイムストリーミング | gemini-3.5-transcribe-live |
Live APIを介した、1秒未満のレイテンシによる継続的な双方向ストリーミング |
| 録音済み音声 | gemini-3.5-transcribe |
Interactions APIを介した、録音音声、会議、通話履歴の処理 |
録音済みのパスが、会議向けの機能を備えている方です。Googleはこれを、「録音された音声、会議、通話履歴などを、話者の特定や単語レベルのタイムスタンプ付きで文字起こしする」と説明しています。
話者識別のサポートには上限が明記されています。このモデルは「録音済み音声内の発言を、最大3人の話者までタイムスタンプ付きで正確に特定」し、3人を超えるサポートは実験的なものとされています。
スマート文字起こしが実際にもたらす変化
4つの機能が挙げられており、これらが単なる文字起こしとの実用的な違いとなります。
言い淀みのクリーンアップ。 モデルは「火曜日に会いましょう、いや、水曜日です」といった自己修正を処理し、フィラーを除去して、出力を自動的にフォーマットします。
カスタム語彙。 独自の用語を提供できるため、専門用語や珍しいスペルも文字起こしプロセスで正しく処理されます。
英数字の正確性。 Googleは「郵便番号や注文IDなどの英数字エンティティ」を特に挙げており、これは一般的なモデルが失敗しやすい部分です。
対応言語。 モデルは地域のアクセントや方言を含む、85以上の言語を自動的に検出します。
また、注目に値するファンクションコーリング機能もあります。Googleによると、このモデルは「ファンクションコーリングを介して、複雑なタスク(画像生成やファイル分析など)を他のGeminiモデルに委託できる」とのことです。この機能は現在、macOS向けのGeminiアプリのみで提供されていると記載されています。
現在利用可能な場所
モデルのローンチとしては珍しく、今回のリリースはAPI限定ではありません。
| プラットフォーム | 提供される機能 |
|---|---|
| Google AI StudioのGemini API | 音声によるアプリのコーディングを含むビルドモード |
| Gemini Enterprise Agent Platform | 同一モデル、企業向けデプロイパス |
| AndroidのGboard | Rambler機能が音声をフォーマットされたテキストに変換 |
| macOSのGeminiアプリ | 画面のコンテキストと組み合わせた音声コマンド |
| Google Antigravity | 画面のコンテキストとチャット履歴を利用した文字起こし |
| Chrome | 任意の入力欄で音声入力を行う機能として、近日公開予定と記載 |
macOSでの説明は、この中で最もエージェントらしいものです。Googleは、このモデルによって「ローカルファイルの要約、アプリ間でのテキストの再利用、カーソル位置での画像生成」が簡単に行えるようになると述べています。これらはすべて音声操作のみで実行されます。
LangChain、LiveKit、Pipecat、Vercelなど、複数の開発者プラットフォームがLive APIをベースに構築を進めていると名指しされています。
アクセスに関する注意点として、見落としがちな点があります。2つのAPIパスは異なるモデルIDと異なるエントリーポイントを持っています。そのため、リアルタイム字幕の構築と会議アーカイブの構築は、1つではなく2つのインテグレーションとして扱う必要があります。
発表でカバーされていないこと
ここからが文字起こしだけでは不十分になる領域であり、憶測に頼るのではなく、そのギャップを明確に述べる価値があります。
発表ページに記載されているのはテキスト出力についてです。音声からスプレッドシート、グラフ、スライド資料、または書面によるレポートを作成することについては説明されていません。スプレッドシート、Excel、CSV、スライド、資料、レポート、ダッシュボードという言葉はどこにも登場しません。
説明されているのは「委託」です。このモデルはファイル分析や画像生成を他のGeminiモデルに引き渡します。つまり、成果物は別の場所で、別の何かによって組み立てられることになります。
これは合理的な設計です。同時に、優れた文字起こしデータがあるだけでは、会議のプロセスを完結できない理由でもあります。
文字起こしを送信可能な成果物に変換する
文字起こしは発言内容を記録するものです。しかし、会議の記録には通常、さらに3つの要素が必要です。画面に表示されていた数値、決定事項、および次のアクションの担当者です。
Powerdrill Bloomはこの後半部分を担います。音声と、会議で実際に使われたファイルをアップロードし、そこから何を得たいかを自然言語で指示します。
The speech to textのページには、.mp3、.mp4、.m4a、.webmなど、いくつかのフォーマットでの音声アップロードがリストされています。この機能は「音声から文字起こし、要約、要点を数秒で取得する」と説明されています。
逆の境界線についても公平に見ておきましょう。そのページには、話者の特定、単語レベルのタイムスタンプ、またはリアルタイムストリーミングについては記載されていません。これらこそが、まさにGoogleがリリースした機能です。3人での通話から話者識別され、タイムスタンプが付与された出力を必要とする場合、そのステップにおいては新しいモデルの方が適したツールです。
両者の重複がなくなるのは、成果物の作成部分です。AI report generatorのページでは、ソースファイルを書面によるレポートに変換する方法が説明されており、ProプランではOfficeドキュメントの出力がリストされています。
知っておくべき代替手段
音声インターフェースではなく、会議の記録を作成することが目的である場合、他に3つのルートが存在します。
会議プラットフォーム独自の要約機能。 Microsoft Teamsは、録画されたイベントの終了後、録画データ、共有ファイル、メモ、アジェンダ、フォローアップタスクを1か所に集約します。インテリジェントな要約機能を利用するには、Teams PremiumまたはCopilotライセンスが必要です。
専用のノート作成ツール。 これらは通話に参加し、要約を作成して、その記録を自社製品内に保存します。会議そのものが成果物である場合に適しています。
テキスト出力とソースファイルの組み合わせ。 設定に時間はかかりますが、まとめられたレポート内の数値が、誰かが音読した内容からではなく、エクスポートデータから直接取得される唯一のルートです。
どれが適しているかは、「会議の価値ある部分は、人々が話した内容なのか、それともデータが示した内容なのか」という1つの問いにかかっています。最初の3つのルートは前者に適しています。後者に対応できるのは最後のルートだけです。
文字起こしから成果物へ
Gemini 3.5 Transcribeは、特定の課題に対する確実な一歩です。よりクリーンなテキスト、3人の話者特定、単語レベルのタイムスタンプ、そして85以上の言語への対応により、これまですべての録音後に行われていた編集作業が軽減されます。
このモデルが行わないのは、会議が何を創出したかを判断することです。それは依然として議論の背景にあるデータから得られるものであり、だからこそ文字起こしデータとソースファイルは同じ場所に置かれるべきなのです。
当社のGemini Deep Researchとの比較では、同じ問いのリサーチ側面について取り上げています。録音データとソースファイルを完成された要約に変換するには、Powerdrill Bloomをお試しください。
本記事の情報は、2026年8月31日時点のGoogleの発表ページに基づいています。
よくある質問
Gemini 3.5 Transcribeとは何ですか?
2026年8月26日に発表されたGoogleの音声文字起こしモデルです。Googleは、生の音声を洗練されたフォーマット済みのテキストに変換する、同社史上最も高精度な音声文字起こしモデルと説明しています。
Gemini 3.5 Transcribeの精度はどのくらいですか?
Googleは、Artificial Analysisによる測定値として、ストリーミングで4.0%、非ストリーミングのユースケースで2.6%の平均単語誤り率(Word Error Rate)を公表しています。FLEURSベンチマークでは、これらの数値はそれぞれ5.50%と5.04%です。
何人の話者を識別できますか?
録音済み音声において、タイムスタンプ付きで最大3人までの話者を識別できます。3人を超える話者のサポートは実験的なものとされています。
Gemini 3.5 Transcribeにはどのようにアクセスできますか?
Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformを通じてアクセスできます。また、AndroidのGboard、macOSのGeminiアプリ、Google Antigravityの音声機能にも採用されており、Chromeについても近日公開予定とされています。
会議の要約を自動で作成してくれますか?
発表では、完成されたドキュメントの作成ではなく、文字起こしと他のGeminiモデルへの委託について説明されています。根拠となる数値を含んだ書面による記録を作成することは別のステップであり、音声だけでなくソースファイルも必要となります。