Gemini 3.5 Transcribe: Meeting-Transkripte, Zugriff und Alternativen (2026)

Google hat Gemini 3.5 Transcribe am 26. August 2026 eingeführt. Es handelt sich um ein Speech-to-Text-Modell, das rohes Audio in formatierten Text umwandelt, inklusive Sprecherzuordnung und Zeitstempeln auf Wortebene bei vorab aufgenommenen Dateien. Dieser Leitfaden zeigt, was veröffentlicht wurde, wo Sie es nutzen können und was noch passieren muss, bevor aus einem Transkript etwas wird, das Sie versenden können.
Was Google am 26. August angekündigt hat
Die Ankündigung ist kurz und konkret. Google nennt es „unser bisher präzisestes Speech-to-Text-Modell, entwickelt für intelligente Sprachinteraktionen.“
Die Formulierung steht im Kontrast zu älterer Spracherkennung. Laut Googles Ankündigung haben herkömmliche Modelle „Probleme mit Hintergrundgeräuschen, komplexem Fachjargon und der Bereinigung von Sprechpausen oder Versprechern.“ Dieses Modell, so Google, „wandelt rohes Audio direkt in präzisen, geschliffenen und formatierten Text um.“
Es wurden zwei Genauigkeitswerte veröffentlicht. Gemessen von Artificial Analysis erreicht das Modell eine durchschnittliche Wortfehlerrate (Word Error Rate) von 4.0% für Streaming und 2.6% für Non-Streaming-Anwendungsfälle.
Google vergleicht es auch mit Chirp 3, dem zuvor verwendeten Modell. Die Zeit bis zur endgültigen Ausgabe „verbessert sich um 70%“, und im FLEURS-Benchmark verzeichnet es eine WER von 5.50% beim Streaming und 5.04% beim Non-Streaming.
Diese Zahlen sind weniger wichtig als das Format des Ergebnisses. Eine sauberere Rohtextdatei bedeutet weniger Nachbearbeitung, bevor sie verwendet werden kann.
Die zwei Bereitstellungswege des Modells
Es gibt zwei separate APIs, und diese Aufteilung ist wichtig, wenn Meetings Ihr Anwendungsfall sind.
| Modus | Modell-ID | Einsatzzweck |
|---|---|---|
| Echtzeit-Streaming | gemini-3.5-transcribe-live |
Kontinuierliches bidirektionales Streaming mit einer Latenz von unter einer Sekunde über die Live API |
| Vorab aufgenommenes Audio | gemini-3.5-transcribe |
Aufgenommenes Audio, Meetings und Anrufprotokolle über die Interactions API |
Der Pfad für vorab aufgenommene Dateien bietet die Meeting-Funktionen. Google beschreibt dies als Transkribieren von „aufgenommenem Audio, Meetings, Anrufprotokollen und mehr mit Sprecherzuordnung und Zeitstempeln auf Wortebene.“
Die Sprecherunterstützung hat eine festgelegte Obergrenze. Das Modell „ordnet Sprache in vorab aufgenommenem Audio mit Zeitstempeln für bis zu drei Sprecher präzise zu“, und die Unterstützung für mehr als drei Sprecher wird als experimentell beschrieben.
Was intelligente Transkription tatsächlich verändert
Es werden vier Funktionen aufgelistet, die den praktischen Unterschied zu einem einfachen Transkript ausmachen.
Bereinigung von Versprechern. Das Modell verarbeitet Selbstkorrekturen wie „Treffen wir uns am Dienstag – nein, am Mittwoch“, entfernt Füllwörter und formatiert die Ausgabe automatisch.
Benutzerdefiniertes Vokabular. Sie können eigene Begriffe vorgeben, damit spezieller Fachjargon und ungewöhnliche Schreibweisen im Prozess erhalten bleiben.
Alphanumerische Genauigkeit. Google hebt besonders „alphanumerische Entitäten wie Postleitzahlen und Bestell-IDs“ hervor, bei denen generische Modelle meist scheitern.
Sprachabdeckung. Das Modell erkennt automatisch über 85 Sprachen, einschließlich regionaler Akzente und Dialekte.
Bemerkenswert ist auch die Funktion zur Funktionsaufrufung (Function Calling). Google gibt an, dass das Modell „komplexe Aufgaben (wie Bildgenerierung und Dateianalyse) über Funktionsaufrufe an andere Gemini-Modelle delegieren kann“. Diese Funktion ist derzeit nur für die Gemini macOS-App gelistet.
Wo Sie es heute schon nutzen können
Dies ist keine reine API-Veröffentlichung, was für den Start eines Modells ungewöhnlich ist.
| Plattform | Funktion vor Ort |
|---|---|
| Gemini API in Google AI Studio | Build-Modus, einschließlich der App-Programmierung per Sprache |
| Gemini Enterprise Agent Platform | Dasselbe Modell, Bereitstellungspfad für Unternehmen |
| Gboard auf Android | Die Rambler-Funktion verwandelt Sprache in formatierten Text |
| Gemini-App auf macOS | Sprachbefehle kombiniert mit Bildschirmkontext |
| Google Antigravity | Transkription unter Nutzung von Bildschirmkontext und Chatverlauf |
| Chrome | Als „demnächst verfügbar“ beschrieben, für die Spracheingabe in jedem beliebigen Feld |
Die macOS-Beschreibung wirkt am ehesten wie ein KI-Agent. Google erklärt, dass das Modell es mühelos macht, „lokale Dateien zusammenzufassen, Text app-übergreifend wiederzuverwenden oder Bilder direkt an der Cursorposition zu generieren.“ All das wird allein per Sprache gesteuert.
Mehrere Entwicklerplattformen wurden genannt, die auf der Live API aufbauen, darunter LangChain, LiveKit, Pipecat und Vercel.
Ein wichtiger Hinweis zum Zugriff wird leicht übersehen. Die beiden API-Pfade haben separate Modell-IDs und separate Einstiegspunkte. Eine Integration für Live-Untertitelung und eine für ein Meeting-Archiv sind daher zwei verschiedene Integrationen, nicht eine.
Was die Ankündigung nicht abdeckt
Hier reicht ein Transkript nicht mehr aus, und diese Lücke sollte man klar benennen, anstatt nur zu mutmaßen.
Die Ankündigungsseite beschreibt die Textausgabe. Sie beschreibt nicht die Erstellung einer Tabelle, eines Diagramms, einer Präsentation oder eines schriftlichen Berichts aus dem Audio. Die Wörter spreadsheet, Excel, CSV, slide, deck, report und dashboard tauchen dort nirgends auf.
Was sie jedoch beschreibt, ist Delegation: Das Modell übergibt die Dateianalyse und Bildgenerierung an andere Gemini-Modelle. Das Endergebnis wird also an anderer Stelle von einem anderen Tool zusammengestellt.
Das ist ein sinnvoller Ansatz. Es ist aber auch der Grund, warum ein gutes Transkript ein Meeting noch nicht vollständig abschließt.
Aus einem Transkript etwas machen, das Sie versenden können
Ein Transkript hält fest, was gesagt wurde. Ein Meeting-Protokoll benötigt in der Regel noch drei weitere Dinge: die Zahlen, die auf dem Bildschirm zu sehen waren, die getroffenen Entscheidungen und wer als Nächstes wofür verantwortlich ist.
Powerdrill Bloom setzt an dieser zweiten Hälfte an. Sie laden das Audio und die Datei hoch, um die es im Meeting eigentlich ging, und beschreiben dann in natürlicher Sprache, was Sie als Ergebnis erhalten möchten.
Die Speech-to-Text-Seite listet Audio-Uploads in den Formaten .mp3, .mp4, .m4a, .webm und einigen anderen auf. Dort heißt es, die Funktion „erstellt in Sekundenschnelle Transkripte, Zusammenfassungen und die wichtigsten Punkte aus Ihrem Audio“.
Um auch die Grenze in die andere Richtung fair aufzuzeigen: Diese Seite beschreibt keine Sprecherzuordnung, Zeitstempel auf Wortebene oder Echtzeit-Streaming. Genau das ist es, was Google geliefert hat. Wenn Sie eine nach Sprechern getrennte, mit Zeitstempeln versehene Ausgabe eines Gesprächs mit drei Personen benötigen, ist das neue Modell das bessere Werkzeug für diesen Schritt.
Wo die Überschneidung der beiden endet, ist das fertige Arbeitsergebnis. Die Seite des AI Report Generator beschreibt die Umwandlung von Quelldateien in einen schriftlichen Bericht, und die Ausgabe als Office-Dokument ist im Pro-Tarif aufgeführt.
Wissenswerte Alternativen
Wenn Ihr Ziel eher Meeting-Protokolle als Sprachschnittstellen sind, gibt es drei andere Wege.
Das eigene Recap Ihrer Meeting-Plattform. Microsoft Teams sammelt nach jeder aufgezeichneten Veranstaltung die Aufnahme, freigegebene Dateien, Notizen, die Agenda und Folgeaufgaben an einem Ort. Intelligente Recap-Funktionen erfordern Teams Premium oder eine Copilot-Lizenz.
Ein dedizierter Notizen-Bot. Diese nehmen am Anruf teil, erstellen eine Zusammenfassung und speichern das Protokoll in ihrem eigenen Produkt. Gut, wenn das Meeting selbst das Arbeitsergebnis ist.
Textausgabe plus Ihre Quelldatei. Langsamer einzurichten, aber der einzige Weg, bei dem die Zahlen in der Zusammenfassung aus dem Export stammen und nicht davon, dass jemand sie laut vorliest.
Welcher Weg der richtige ist, hängt von einer einzigen Frage ab: Ist der wertvolle Teil des Meetings das, was die Leute gesagt haben, oder das, was die Daten gezeigt haben? Die ersten drei Wege bedienen Ersteres gut. Nur der letzte Weg bedient Letzteres.
Vom Transkript zum fertigen Arbeitsergebnis
Gemini 3.5 Transcribe ist ein echter Fortschritt bei einem eng umgrenzten Problem. Saubererer Text, Sprecherzuordnung für drei Personen, Zeitstempel auf Wortebene und über 85 Sprachen reduzieren den Nachbearbeitungsaufwand, der früher auf jede Aufnahme folgte.
Was es jedoch nicht tut, ist zu entscheiden, was das Meeting hervorgebracht hat. Das ergibt sich immer noch aus den Daten hinter der Diskussion, weshalb das Transkript und die Quelldatei an denselben Ort gehören.
Unser Vergleich mit Gemini Deep Research deckt die Recherche-Seite derselben Frage ab. Um eine Aufnahme und ihre Quelldatei in eine fertige Zusammenfassung zu verwandeln, probieren Sie Powerdrill Bloom aus.
Die Fakten hier entsprechen dem Stand vom 31. August 2026 von Googles Ankündigungsseite.
Häufig gestellte Fragen
Was ist Gemini 3.5 Transcribe?
Es ist Googles am 26. August 2026 angekündigtes Speech-to-Text-Modell. Google beschreibt es als sein bisher präzisestes Speech-to-Text-Modell, das rohes Audio in geschliffenen, formatierten Text umwandelt.
Wie genau ist Gemini 3.5 Transcribe?
Google gibt eine durchschnittliche Wortfehlerrate (Word Error Rate) von 4.0% für Streaming und 2.6% für Non-Streaming-Anwendungsfälle an, gemessen von Artificial Analysis. Im FLEURS-Benchmark liegen die Werte bei 5.50% und 5.04%.
Wie viele Sprecher kann es identifizieren?
Bis zu drei Sprecher in vorab aufgenommenem Audio, inklusive Zeitstempeln. Google beschreibt die Unterstützung für mehr als drei Sprecher als experimentell.
Wie erhalte ich Zugriff auf Gemini 3.5 Transcribe?
Über die Gemini API in Google AI Studio und die Gemini Enterprise Agent Platform. Es betreibt auch die Sprachfunktionen in Gboard auf Android, der Gemini-App auf macOS und Google Antigravity, wobei Chrome als „demnächst verfügbar“ beschrieben wird.
Schreibt es die Meeting-Zusammenfassung für mich?
Die Ankündigung beschreibt die Transkription und die Delegation an andere Gemini-Modelle anstelle von fertigen Dokumenten. Die Erstellung eines schriftlichen Protokolls mit den zugrunde liegenden Zahlen ist ein separater Schritt, der sowohl die Quelldatei als auch das Audio erfordert.