Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe: Transcripciones de reuniones, acceso y alternativas (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe: Transcripciones de reuniones, acceso y alternativas (2026)

Google presentó Gemini 3.5 Transcribe el 26 de agosto de 2026. Es un modelo de voz a texto que convierte audio bruto en texto formateado, con atribución de hablantes y marcas de tiempo a nivel de palabra en archivos pregrabados. Esta guía cubre lo que se ha lanzado, dónde se puede utilizar y qué debe suceder todavía antes de que una transcripción se convierta en algo que se pueda enviar.

Lo que Google anunció el 26 de agosto

El anuncio es breve y específico. Google lo define como "nuestro modelo de voz a texto más preciso hasta la fecha, diseñado para interacciones de voz inteligentes".

El enfoque contrasta con el reconocimiento de voz más antiguo. Según el anuncio de Google, los modelos convencionales "tienen dificultades con el ruido de fondo, la jerga compleja y la limpieza de vacilaciones". Este, según Google, "convierte el audio bruto directamente en texto preciso, pulido y formateado".

Se han publicado dos cifras de precisión. Según las mediciones de Artificial Analysis, el modelo alcanza una tasa de error de palabras (Word Error Rate) promedio del 4.0% para streaming y del 2.6% para casos de uso sin streaming.

Google también lo compara con Chirp 3, el modelo que utilizaba anteriormente. El tiempo hasta el resultado final "mejora en un 70%" y, en la prueba de rendimiento FLEURS, registra un WER del 5.50% en streaming y del 5.04% sin streaming.

Esos números importan menos que el formato del resultado. Un archivo de texto bruto más limpio significa menos edición antes de que cualquiera pueda utilizarlo.

Las dos formas en que se ofrece el modelo

Existen dos API independientes, y la diferencia es importante si su caso de uso son las reuniones.

Modo ID del modelo Para qué está diseñado
Streaming en tiempo real gemini-3.5-transcribe-live Streaming bidireccional continuo con latencia inferior al segundo, a través de la Live API
Audio pregrabado gemini-3.5-transcribe Audio grabado, reuniones e historiales de llamadas, a través de la Interactions API

La opción de audio pregrabado es la que incluye las funciones para reuniones. Google la describe como la transcripción de "audio grabado, reuniones, historiales de llamadas y más, con atribución de hablantes y marcas de tiempo a nivel de palabra".

El soporte para hablantes tiene un límite establecido. El modelo "atribuye con precisión el habla en audio pregrabado con marcas de tiempo para hasta tres hablantes", y el soporte para más de tres se describe como experimental.

Qué cambia realmente con la transcripción inteligente

Se enumeran cuatro capacidades, que representan la diferencia práctica respecto a una transcripción simple.

Limpieza de vacilaciones. El modelo gestiona autocorrecciones como "reunámonos el martes... no, el miércoles", elimina muletillas y formatea automáticamente el resultado.

Vocabulario personalizado. Puede proporcionar sus propios términos para que la jerga especializada y las ortografías poco comunes se conserven en el proceso.

Precisión alfanumérica. Google destaca las "entidades alfanuméricas como códigos postales e ID de pedidos", que es donde los modelos genéricos suelen fallar.

Cobertura de idiomas. El modelo detecta automáticamente más de 85 idiomas, incluidos acentos regionales y dialectos.

También vale la pena señalar la capacidad de llamada a funciones (function-calling). Google afirma que el modelo "can delegar tareas complejas (como la generación de imágenes y el análisis de archivos) a otros modelos Gemini a través de llamadas a funciones". Actualmente, esa capacidad solo está disponible para la aplicación de Gemini para macOS.

Dónde se puede utilizar hoy en día

Este no es un lanzamiento exclusivo para API, lo cual es inusual en el lanzamiento de un modelo.

Entorno Qué hace allí
Gemini API en Google AI Studio Modo de construcción, incluyendo la programación de aplicaciones por voz
Gemini Enterprise Agent Platform Mismo modelo, ruta de despliegue empresarial
Gboard en Android La función Rambler convierte la voz en texto formateado
Gemini app en macOS Comandos de voz combinados con el contexto de la pantalla
Google Antigravity Transcripción que utiliza el contexto de la pantalla y el historial de chat
Chrome Descrito como disponible próximamente, para escribir por voz en cualquier campo

La descripción para macOS es la que más se asemeja a un agente de todo el conjunto. Google afirma que el modelo facilita enormemente "resumir archivos locales, reutilizar texto en diferentes aplicaciones o generar imágenes directamente donde está el cursor". Todo ello funciona únicamente con la voz.

Se mencionan varias plataformas de desarrolladores que están construyendo sobre la Live API, incluyendo LangChain, LiveKit, Pipecat y Vercel.

Hay un detalle sobre el acceso que es fácil pasar por alto. Las dos rutas de API tienen ID de modelo y puntos de entrada independientes. Por lo tanto, una integración para subtitulado en directo y otra para el archivo de reuniones son dos integraciones distintas, no una sola.

Lo que el anuncio no cubre

Aquí es donde una transcripción deja de ser suficiente, y vale la pena exponer claramente esta limitación en lugar de hacer suposiciones.

La página del anuncio describe resultados de texto. No describe la generación de una hoja de cálculo, un gráfico, una presentación o un informe escrito a partir del audio. Las palabras spreadsheet, Excel, CSV, slide, deck, report y dashboard no aparecen en ninguna parte.

Lo que sí describe es la delegación: el modelo transfiere el análisis de archivos y la generación de imágenes a otros modelos Gemini. Por lo tanto, el entregable se elabora en otro lugar, mediante otra herramienta.

Es un diseño razonable. También es la razón por la que una buena transcripción no completa el ciclo de una reunión.

Convertir una transcripción en algo que se pueda enviar

Una transcripción registra lo que se dijo. El acta de una reunión suele necesitar tres cosas más: los números que aparecieron en pantalla, las decisiones tomadas y quién se encarga de cada tarea a continuación.

Powerdrill Bloom se encarga de esa segunda mitad. Usted sube el audio y el archivo sobre el que realmente trató la reunión, y luego describe en lenguaje natural lo que desea obtener de ellos.

La página de voz a texto enumera subidas de audio en formatos .mp3, .mp4, .m4a, .webm y varios otros. Indica que la función "obtiene transcripciones, resúmenes y puntos principales de su audio en segundos".

Para ser justos con el límite en la otra dirección: esa página no describe la atribución de hablantes, las marcas de tiempo a nivel de palabra ni el streaming en tiempo real. Eso es exactamente lo que Google ha lanzado. Si necesita un resultado con marcas de tiempo y diferenciación de hablantes para una llamada de tres personas, el nuevo modelo es la mejor herramienta para ese paso.

Donde ambos dejan de solaparse es en el entregable final. La página del generador de informes de IA cubre la conversión de archivos de origen en un informe escrito, y la exportación a documentos de Office se incluye en el plan Pro.

Alternativas que vale la pena conocer

Si su objetivo es obtener actas de reuniones en lugar de interfaces de voz, existen otras tres vías.

El propio resumen de su plataforma de reuniones. Microsoft Teams recopila la grabación, los archivos compartidos, las notas, la agenda y las tareas de seguimiento en un solo lugar después de cualquier evento grabado. Las funciones de resumen inteligente requieren Teams Premium o una licencia de Copilot.

Un asistente de notas dedicado. Estos participan en la llamada, generan un resumen y guardan el registro dentro de su propio producto. Es una buena opción cuando la reunión en sí es el entregable.

Resultado de texto más su archivo de origen. Es más lento de configurar, pero es la única vía en la que los números del informe final provienen de la exportación en lugar de que alguien los lea en voz alta.

Cuál de ellas se adapta mejor depende de una sola pregunta: ¿la parte valiosa de la reunión es lo que la gente dijo o lo que mostraron los datos? Las tres primeras vías responden bien a lo primero. Solo la última responde a lo segundo.

De la transcripción al entregable

Gemini 3.5 Transcribe es un paso real en un problema acotado. Un texto más limpio, la atribución de hasta tres hablantes, las marcas de tiempo a nivel de palabra y más de 85 idiomas reducen el trabajo de edición que solía seguir a cada grabación.

Lo que no hace es decidir qué produjo la reunión. Eso sigue proviniendo de los datos que respaldan la discusión, razón por la cual la transcripción y el archivo de origen deben estar en el mismo lugar.

Nuestra comparación con Gemini Deep Research cubre el aspecto de investigación de la misma cuestión. Para convertir una grabación y su archivo de origen en un resumen finalizado, pruebe Powerdrill Bloom.

Los datos presentados aquí corresponden al 31 de agosto de 2026, obtenidos de la página de anuncios de Google.

Preguntas frecuentes

¿Qué es Gemini 3.5 Transcribe?

Es el modelo de voz a texto de Google anunciado el 26 de agosto de 2026. Google lo describe como su modelo de voz a texto más preciso hasta la fecha, capaz de convertir audio bruto en texto pulido y formateado.

¿Qué tan preciso es Gemini 3.5 Transcribe?

Google publica una tasa de error de palabras (Word Error Rate) promedio del 4.0% para streaming y del 2.6% para casos de uso sin streaming, según las mediciones de Artificial Analysis. En la prueba de rendimiento FLEURS, las cifras son del 5.50% y del 5.04%.

¿Cuántos hablantes puede identificar?

Hasta tres hablantes en audio pregrabado, con marcas de tiempo. Google describe el soporte para más de tres hablantes como experimental.

¿Cómo puedo acceder a Gemini 3.5 Transcribe?

A través de la Gemini API en Google AI Studio y de la Gemini Enterprise Agent Platform. También impulsa funciones de voz en Gboard en Android, la aplicación Gemini en macOS y Google Antigravity, y se ha anunciado que próximamente estará disponible en Chrome.

¿Escribe el resumen de la reunión por mí?

El anuncio describe la transcripción y la delegación en otros modelos Gemini, en lugar de la creación de documentos finalizados. Generar un registro escrito con las cifras subyacentes es un paso independiente, y requiere tanto el archivo de origen como el audio.