Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe: Vergadertranscripten, toegang en alternatieven (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe: Vergadertranscripten, toegang en alternatieven (2026)

Google heeft op 26 augustus 2026 Gemini 3.5 Transcribe geïntroduceerd. Het is een speech-to-text-model dat ruwe audio omzet in geformatteerde tekst, met sprekeridentificatie en tijdstempels op woordniveau voor vooraf opgenomen bestanden. Deze gids behandelt wat er is uitgebracht, waar u het kunt gebruiken en wat er nog moet gebeuren voordat een transcriptie verandert in iets dat u kunt verzenden.

Wat Google op 26 augustus aankondigde

De aankondiging is kort en specifiek. Google noemt het "ons meest nauwkeurige speech-to-text-model tot nu toe, ontworpen voor intelligente spraakinteracties."

De positionering vormt een contrast met oudere spraakherkenning. Volgens de aankondiging van Google hebben conventionele modellen "moeite met achtergrondgeluid, complex jargon en het opschonen van haperingen." Dit model, zo stelt Google, "zet ruwe audio direct om in nauwkeurige, gepolijste, geformatteerde tekst."

Er zijn twee nauwkeurigheidscijfers gepubliceerd. Gemeten door Artificial Analysis behaalt het model een gemiddelde Word Error Rate van 4,0% voor streaming en 2,6% voor niet-streaming use cases.

Google vergelijkt het ook met Chirp 3, het model dat voorheen werd gebruikt. De tijd tot de uiteindelijke uitvoer "verbetert met 70%" en op de FLEURS-benchmark noteert het model een WER van 5,50% bij streaming en 5,04% bij niet-streaming.

Die cijfers zijn minder belangrijk dan het formaat van het resultaat. Een schoner ruw tekstbestand betekent minder bewerkingen voordat iemand het kan gebruiken.

De twee manieren waarop het model wordt aangeboden

Er zijn twee afzonderlijke API's, en dat onderscheid is belangrijk als vergaderingen uw use case zijn.

Modus Model-ID Waarvoor het is gebouwd
Realtime streaming gemini-3.5-transcribe-live Continue bidirectionele streaming met latentie van minder dan een seconde, via de Live API
Vooraf opgenomen audio gemini-3.5-transcribe Opgenomen audio, vergaderingen en oproeplogboeken, via de Interactions API

Het pad voor vooraf opgenomen audio is degene die de vergaderfuncties bevat. Google omschrijft het als het transcriberen van "opgenomen audio, vergaderingen, oproeplogboeken en meer met sprekeridentificatie en tijdstempels op woordniveau."

De ondersteuning voor sprekers heeft een vastgesteld plafond. Het model "wijst spraak in vooraf opgenomen audio nauwkeurig toe met tijdstempels voor maximaal drie sprekers", en ondersteuning voor meer dan drie sprekers wordt als experimenteel omschreven.

Wat slimme transcriptie daadwerkelijk verandert

Er worden vier functies genoemd, en die vormen het praktische verschil met een gewone transcriptie.

Opschonen van haperingen. Het model verwerkt zelfcorrecties zoals "laten we dinsdag afspreken—nee, woensdag", verwijdert stopwoorden en formatteert de uitvoer automatisch.

Aangepaste woordenschat. U kunt uw eigen termen opgeven, zodat gespecialiseerd jargon en ongebruikelijke spellingen het proces overleven.

Alfanumerieke nauwkeurigheid. Google wijst specifiek op "alfanumerieke entiteiten zoals postcodes en bestel-ID's", het punt waarop generieke modellen meestal falen.

Taaldekking. Het model detecteert automatisch meer dan 85 talen, inclusief regionale accenten en dialecten.

Er is ook een functie-aanroepfunctie (function-calling) die het vermelden waard is. Google zegt dat het model "complexe taken (zoals het genereren van afbeeldingen en bestandsanalyse) kan delegeren aan andere Gemini-modellen via function calls." Die functie is momenteel alleen beschikbaar voor de Gemini macOS-app.

Waar u het vandaag nog kunt gebruiken

Dit is geen release die uitsluitend via een API verloopt, wat ongebruikelijk is voor de lancering van een model.

Platform Wat het daar doet
Gemini API in Google AI Studio Bouwmodus, inclusief het coderen van apps met uw stem
Gemini Enterprise Agent Platform Zelfde model, implementatietraject voor ondernemingen
Gboard op Android De Rambler-functie zet spraak om in geformatteerde tekst
Gemini-app op macOS Spraakopdrachten gekoppeld aan schermcontext
Google Antigravity Transcriptie die gebruikmaakt van schermcontext en chatgeschiedenis
Chrome Omschreven als binnenkort beschikbaar, om met uw stem te typen in elk veld

De macOS-beschrijving is de meest agent-achtige van de set. Google zegt dat het model het moeiteloos maakt "om lokale bestanden samen te vatten, tekst in verschillende apps opnieuw te gebruiken of afbeeldingen rechtstreeks bij uw cursor te genereren." Dit alles werkt uitsluitend op basis van spraak.

Verschillende ontwikkelaarsplatforms worden genoemd als partijen die bouwen op de Live API, waaronder LangChain, LiveKit, Pipecat en Vercel.

Een belangrijk detail over de toegang is gemakkelijk over het hoofd te zien. De twee API-paden hebben afzonderlijke model-ID's en afzonderlijke toegangspunten. Een integratie voor live ondertiteling en een integratie voor een vergaderarchief zijn daarom twee verschillende integraties, niet één.

Wat de aankondiging niet behandelt

Dit is het punt waarop een transcriptie niet meer voldoende is, en het is de moeite waard om deze kloof duidelijk te benoemen in plaats van ernaar te gissen.

De aankondigingspagina beschrijft tekstuitvoer. Er wordt niet gesproken over het produceren van een spreadsheet, een grafiek, een presentatie of een geschreven rapport op basis van de audio. De woorden spreadsheet, Excel, CSV, slide, deck, rapport en dashboard komen er nergens op voor.

Wat het wel beschrijft is delegatie: het model draagt bestandsanalyse en het genereren van afbeeldingen over aan andere Gemini-modellen. Het eindproduct wordt dus ergens anders, door iets anders, samengesteld.

Dat is een logisch ontwerp. Het is ook de reden waarom een goede transcriptie een vergadering nog niet volledig afrondt.

Een transcriptie veranderen in iets dat u kunt verzenden

Een transcriptie legt vast wat er is gezegd. Een verslag van een vergadering heeft meestal nog drie dingen nodig: de cijfers die op het scherm stonden, de beslissingen en wie vervolgens waarvoor verantwoordelijk is.

Powerdrill Bloom richt zich op die tweede helft. U uploadt de audio en het bestand waar de vergadering daadwerkelijk over ging, en beschrijft vervolgens in natuurlijke taal wat u eruit wilt halen.

De speech to text-pagina vermeldt audio-uploads in .mp3, .mp4, .m4a, .webm en diverse andere formaten. Er staat dat de functie "binnen enkele seconden transcripties, samenvattingen en de belangrijkste punten uit uw audio haalt."

Om eerlijk te zijn over de grens in de andere richting: die pagina beschrijft geen sprekeridentificatie, tijdstempels op woordniveau of realtime streaming. Dat is nu precies wat Google heeft uitgebracht. Als u gesegmenteerde, van tijdstempels voorziene uitvoer van een gesprek met drie personen nodig hebt, is het nieuwe model het betere hulpmiddel voor die stap.

Waar de twee ophouden te overlappen, is het eindproduct. De AI-rapportgenerator-pagina behandelt het omzetten van bronbestanden in een geschreven rapport, en de uitvoer als Office-documenten is opgenomen in het Pro-abonnement.

Alternatieven die het waard zijn om te kennen

Als uw doel het maken van vergaderverslagen is in plaats van spraakinterfaces, zijn er drie andere routes mogelijk.

De eigen samenvatting van uw vergaderplatform. Microsoft Teams verzamelt de opname, gedeelde bestanden, notities, de agenda en vervolgtaken op één plek na elk opgenomen evenement. Voor intelligente samenvattingsfuncties is Teams Premium of een Copilot-licentie vereist.

Een speciale notulist. Deze nemen deel aan het gesprek, maken een samenvatting en bewaren het verslag in hun eigen product. Handig wanneer de vergadering zelf het eindproduct is.

Tekstuitvoer plus uw bronbestand. Dit is langzamer in te stellen, maar het is de enige route waarbij de cijfers in het verslag afkomstig zijn uit de export in plaats van dat iemand ze hardop voorleest.

Welke optie het beste past, hangt af van één vraag: is het waardevolle deel van de vergadering wat mensen zeiden, of wat de gegevens lieten zien? De eerste drie routes bedienen het eerste goed. Alleen de laatste route bedient het tweede.

Van transcriptie naar eindproduct

Gemini 3.5 Transcribe is een echte stap voorwaarts bij een specifiek probleem. Schonere tekst, sprekeridentificatie voor drie sprekers, tijdstempels op woordniveau en meer dan 85 talen verminderen allemaal het bewerkingswerk dat voorheen op elke opname volgde.

Wat het model niet doet, is bepalen wat de vergadering heeft opgeleverd. Dat is nog steeds afkomstig van de gegevens achter de discussie, en dat is waarom de transcriptie en het bronbestand op dezelfde plek thuishoren.

Onze vergelijking met Gemini Deep Research behandelt de onderzoekszijde van dezelfde vraag. Om een opname en het bijbehorende bronbestand om te zetten in een volwaardige samenvatting, kunt u Powerdrill Bloom proberen.

De feiten hier zijn actueel vanaf 31 augustus 2026, afkomstig van de aankondigingspagina van Google.

Veelgestelde vragen

Wat is Gemini 3.5 Transcribe?

Het is het speech-to-text-model van Google dat op 26 augustus 2026 is aangekondigd. Google omschrijft het als zijn meest nauwkeurige speech-to-text-model tot nu toe, dat ruwe audio omzet in gepolijste, geformatteerde tekst.

Hoe nauwkeurig is Gemini 3.5 Transcribe?

Google publiceert een gemiddelde Word Error Rate van 4,0% voor streaming en 2,6% voor niet-streaming use cases, gemeten door Artificial Analysis. Op de FLEURS-benchmark zijn de cijfers 5,50% en 5,04%.

Hoeveel sprekers kan het identificeren?

Maximaal drie sprekers in vooraf opgenomen audio, met tijdstempels. Google omschrijft de ondersteuning voor meer dan drie sprekers als experimenteel.

Hoe krijg ik toegang tot Gemini 3.5 Transcribe?

Via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform. Het drijft ook spraakfuncties aan in Gboard op Android, de Gemini-app op macOS en Google Antigravity, waarbij Chrome wordt omschreven als binnenkort beschikbaar.

Schrijft het de samenvatting van de vergadering voor mij?

De aankondiging beschrijft transcriptie en delegatie naar andere Gemini-modellen in plaats van voltooide documenten. Het produceren van een geschreven verslag met de onderliggende cijfers is een aparte stap, waarvoor zowel het bronbestand als de audio nodig is.