Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe : transcriptions de réunions, accès et alternatives (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe : transcriptions de réunions, accès et alternatives (2026)

Google a présenté Gemini 3.5 Transcribe le 26 août 2026. Il s'agit d'un modèle de conversion de la parole en texte qui transforme l'audio brut en texte mis en forme, avec attribution des locuteurs et horodatage au niveau des mots sur les fichiers préenregistrés. Ce guide présente les nouveautés déployées, les plateformes sur lesquelles vous pouvez l'utiliser et les étapes indispensables avant qu'une transcription ne devienne un document prêt à être envoyé.

Ce que Google a annoncé le 26 août

L'annonce est brève et précise. Google le qualifie de « notre modèle de conversion de la parole en texte le plus précis à ce jour, conçu pour des interactions vocales intelligentes. »

Cette approche tranche avec les technologies de reconnaissance vocale plus anciennes. Selon l'annonce de Google, les modèles conventionnels « ont du mal avec le bruit de fond, le jargon complexe et le nettoyage des disfluences ». Celui-ci, affirme Google, « convertit directement l'audio brut en un texte précis, soigné et mis en forme ».

Deux chiffres d'exactitude ont été publiés. Selon les mesures d'Artificial Analysis, le modèle atteint un taux d'erreur de mots (Word Error Rate) moyen de 4,0 % pour le streaming et de 2,6 % pour les cas d'usage hors streaming.

Google le compare également à Chirp 3, le modèle utilisé précédemment. Le délai d'obtention du résultat final « s'améliore de 70 % », et sur le benchmark FLEURS, il enregistre un taux d'erreur (WER) de 5,50 % en streaming et de 5,04 % hors streaming.

Ces chiffres importent moins que le format du résultat obtenu. Un fichier de texte brut plus propre signifie moins de retouches avant de pouvoir l'exploiter.

Les deux façons dont le modèle est proposé

Il existe deux API distinctes, et cette séparation a son importance si votre cas d'usage concerne les réunions.

Mode ID du modèle Conçu pour
Streaming en temps réel gemini-3.5-transcribe-live Streaming bidirectionnel continu avec une latence inférieure à la seconde, via l'API Live
Audio préenregistré gemini-3.5-transcribe Audio enregistré, réunions et journaux d'appels, via l'API Interactions

C'est l'option pour l'audio préenregistré qui intègre les fonctionnalités de réunion. Google la décrit comme permettant de transcrire « de l'audio enregistré, des réunions, des journaux d'appels et bien plus encore, avec attribution des locuteurs et horodatage au niveau des mots ».

La prise en charge des locuteurs a une limite annoncée. Le modèle « attribue avec précision la parole dans l'audio préenregistré avec des horodatages pour un maximum de trois locuteurs », et la prise en charge au-delà de trois est qualifiée d'expérimentale.

Ce que change concrètement la transcription intelligente

Quatre fonctionnalités sont mises en avant, et elles marquent la différence concrète avec une simple transcription brute.

Nettoyage des disfluences. Le modèle gère les autocorrections comme « réunissons-nous mardi — non, mercredi », supprime les mots de remplissage et met en forme automatiquement le résultat.

Vocabulaire personnalisé. Vous pouvez fournir vos propres termes afin que le jargon spécialisé et les orthographes inhabituelles soient correctement transcrits.

Précision alphanumérique. Google met l'accent sur les « entités alphanumériques telles que les codes postaux et les identifiants de commande », là où les modèles génériques ont tendance à échouer.

Couverture linguistique. Le modèle détecte automatiquement plus de 85 langues, y compris les accents régionaux et les dialectes.

Il convient également de noter une fonctionnalité d'appel de fonctions (function-calling). Google indique que le modèle « peut déléguer des tâches complexes (telles que la génération d'images et l'analyse de fichiers) à d'autres Gemini models via des appels de fonctions ». Cette fonctionnalité n'est actuellement répertoriée que pour l'application macOS de Gemini.

Où vous pouvez l'utiliser aujourd'hui

Il ne s'agit pas d'une sortie réservée exclusivement aux API, ce qui est inhabituel pour le lancement d'un modèle.

Interface Ce qu'il y fait
Gemini API dans Google AI Studio Mode de développement, y compris le codage d'applications à la voix
Gemini Enterprise Agent Platform Même modèle, parcours de déploiement en entreprise
Gboard sur Android La fonctionnalité Rambler transforme la parole en texte mis en forme
Application Gemini sur macOS Commandes vocales associées au contexte de l'écran
Google Antigravity Transcription utilisant le contexte de l'écran et l'historique du chat
Chrome Annoncé comme disponible prochainement, pour saisir du texte à la voix dans n'importe quel champ

La description pour macOS est celle qui se rapproche le plus d'un agent. Google affirme que le modèle permet sans effort « de résumer des fichiers locaux, de réutiliser du texte d'une application à l'autre ou de générer des images directement au niveau de votre curseur ». Tout cela fonctionne uniquement à la voix.

Plusieurs plateformes de développement sont mentionnées comme s'appuyant sur l'API Live, notamment LangChain, LiveKit, Pipecat et Vercel.

Un détail concernant l'accès peut facilement passer inaperçu. Les deux parcours d'API ont des ID de modèle distincts et des points d'entrée séparés. Une intégration pour le sous-titrage en direct et une autre pour l'archivage de réunions constituent donc deux intégrations différentes, et non une seule.

Ce que l'annonce ne couvre pas

C'est ici qu'une simple transcription ne suffit plus, et il convient de formuler clairement cette limite plutôt que de faire des suppositions.

La page de l'annonce décrit un résultat textuel. Elle ne mentionne pas la production d'une feuille de calcul, d'un graphique, d'une présentation ou d'un rapport écrit à partir de l'audio. Les mots feuille de calcul, Excel, CSV, diapositive, présentation, rapport et tableau de bord n'y apparaissent nulle part.

Ce qu'elle décrit, en revanche, c'est la délégation : le modèle confie l'analyse de fichiers et la génération d'images à d'autres Gemini models. Le livrable est donc assemblé ailleurs, par un autre outil.

C'est une conception logique. C'est aussi la raison pour laquelle une bonne transcription ne suffit pas à finaliser le suivi d'une réunion.

Transformer une transcription en un document prêt à être envoyé

Une transcription consigne ce qui a été dit. Un compte rendu de réunion nécessite généralement trois éléments supplémentaires : les chiffres affichés à l'écran, les décisions prises et la répartition des prochaines tâches.

Powerdrill Bloom intervient sur cette seconde partie. Vous importez l'audio ainsi que le fichier sur lequel portait réellement la réunion, puis vous décrivez en langage naturel ce que vous souhaitez en obtenir.

La page speech to text répertorie les importations audio aux formats .mp3, .mp4, .m4a, .webm et plusieurs autres. Elle indique que la fonctionnalité « obtient des transcriptions, des résumés et les points clés de votre audio en quelques secondes ».

Pour être tout à fait juste dans l'autre sens : cette page ne décrit pas l'attribution des locuteurs, l'horodatage au niveau des mots ou le streaming en temps réel. C'est précisément ce que Google vient de lancer. Si vous avez besoin d'un compte rendu structuré par locuteur et horodaté pour un appel à trois personnes, le nouveau modèle est le meilleur outil pour cette étape.

Là où les deux outils cessent de se chevaucher, c'est sur la création du livrable final. La page du générateur de rapports IA explique comment transformer des fichiers sources en un rapport écrit, et l'exportation au format de document Office est proposée dans le forfait Pro.

Des alternatives à connaître

Si votre objectif est d'obtenir des comptes rendus de réunion plutôt que des interfaces vocales, trois autres pistes s'offrent à vous.

Le récapitulatif intégré de votre plateforme de réunion. Microsoft Teams rassemble l'enregistrement, les fichiers partagés, les notes, l'ordre du jour et les tâches de suivi en un seul endroit après tout événement enregistré. Les fonctionnalités de récapitulatif intelligent nécessitent Teams Premium ou une licence Copilot.

Un assistant de prise de notes dédié. Ces outils participent à l'appel, rédigent un résumé et conservent le compte rendu au sein de leur propre plateforme. C'est une bonne solution lorsque la réunion elle-même constitue le livrable principal.

Le texte transcrit associé à votre fichier source. Plus long à mettre en place, mais c'est la seule méthode où les chiffres du compte rendu proviennent directement de l'export plutôt que d'une lecture à voix haute par un participant.

Le choix dépend d'une seule question : la valeur de la réunion réside-t-elle dans ce que les gens ont dit ou dans ce que les données ont montré ? Les trois premières options répondent bien au premier cas. Seule la dernière répond au second.

De la transcription au livrable

Gemini 3.5 Transcribe est une véritable avancée sur un problème ciblé. Un texte plus propre, l'attribution jusqu'à trois locuteurs, l'horodatage au niveau des mots et plus de 85 langues réduisent considérablement le travail d'édition qui suivait habituellement chaque enregistrement.

Ce qu'il ne fait pas, en revanche, c'est déterminer ce que la réunion a produit. Cela dépend toujours des données qui sous-tendent la discussion, c'est pourquoi la transcription et le fichier source doivent se trouver au même endroit.

Notre comparatif avec Gemini Deep Research aborde le volet recherche de cette même question. Pour transformer un enregistrement et son fichier source en un résumé finalisé, essayez Powerdrill Bloom.

Les faits présentés ici sont à jour au 31 août 2026, d'après la page d'annonce de Google.

Questions fréquentes

Qu'est-ce que Gemini 3.5 Transcribe ?

Il s'agit du modèle de conversion de la parole en texte de Google annoncé le 26 août 2026. Google le décrit comme son modèle de speech-to-text le plus précis à ce jour, capable de convertir de l'audio brut en un texte soigné et mis en forme.

Quelle est la précision de Gemini 3.5 Transcribe ?

Google annonce un taux d'erreur de mots (Word Error Rate) moyen de 4,0 % pour le streaming et de 2,6 % pour les cas d'usage hors streaming, selon les mesures d'Artificial Analysis. Sur le benchmark FLEURS, ces chiffres sont de 5,50 % et 5,04 % respectivement.

Combien de locuteurs peut-il identifier ?

Jusqu'à trois locuteurs dans l'audio préenregistré, avec horodatage. Google qualifie d'expérimentale la prise en charge de plus de trois locuteurs.

Comment puis-je accéder à Gemini 3.5 Transcribe ?

Via l'API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform. Il alimente également les fonctionnalités vocales de Gboard sur Android, de l'application Gemini sur macOS et de Google Antigravity, Chrome étant annoncé comme disponible prochainement.

Rédige-t-il le résumé de la réunion à ma place ?

L'annonce décrit une transcription et une délégation à d'autres modèles Gemini plutôt que la production de documents finalisés. Rédiger un compte rendu écrit contenant les chiffres clés est une étape distincte, qui nécessite le fichier source en plus de l'audio.