Gemini 3.5 Transcribe: Trascrizioni delle riunioni, accesso e alternative (2026)

Google ha introdotto Gemini 3.5 Transcribe il 26 agosto 2026. Si tratta di un modello speech-to-text che trasforma l'audio grezzo in testo formattato, con attribuzione del parlante e timestamp a livello di singola parola sui file preregistrati. Questa guida illustra le novità rilasciate, dove è possibile utilizzarlo e cosa deve ancora accadere prima che una trascrizione diventi un documento pronto da inviare.
Cosa ha annunciato Google il 26 agosto
L'annuncio è breve e specifico. Google lo definisce "il nostro modello speech-to-text più preciso di sempre, progettato per interazioni vocali intelligenti."
L'approccio si pone in contrasto con i sistemi di riconoscimento vocale più datati. Secondo l'annuncio di Google, i modelli convenzionali "faticano con i rumori di fondo, il gergo complesso e la pulizia delle disfluenze". Questo modello, afferma Google, "converte l'audio grezzo direttamente in un testo accurato, rifinito e formattato".
Sono stati pubblicati due dati sull'accuratezza. Secondo le misurazioni di Artificial Analysis, il modello raggiunge un Word Error Rate medio del 4.0% per lo streaming e del 2.6% per i casi d'uso non in streaming.
Google lo confronta anche con Chirp 3, il modello utilizzato in precedenza. Il tempo per l'output finale "migliora del 70%" e, sul benchmark FLEURS, registra un WER del 5.50% in streaming e del 5.04% non in streaming.
Questi numeri contano meno rispetto al formato del risultato. Un file di testo grezzo più pulito significa meno modifiche prima che chiunque possa utilizzarlo.
Le due modalità in cui viene offerto il modello
Esistono due API distinte e questa suddivisione è importante se il vostro caso d'uso riguarda le riunioni.
| Modalità | Model ID | Per cosa è stato progettato |
|---|---|---|
| Streaming in tempo reale | gemini-3.5-transcribe-live |
Streaming bidirezionale continuo con latenza inferiore al secondo, tramite la Live API |
| Audio preregistrato | gemini-3.5-transcribe |
Audio registrato, riunioni e registri delle chiamate, tramite la Interactions API |
Il percorso per l'audio preregistrato è quello che include le funzionalità per le riunioni. Google lo descrive come uno strumento per trascrivere "audio registrato, riunioni, registri delle chiamate e altro ancora, con attribuzione del parlante e timestamp a livello di parola".
Il supporto per i parlanti ha un limite dichiarato. Il modello "attribuisce accuratamente il parlato nell'audio preregistrato con timestamp fino a tre parlanti", mentre il supporto per più di tre parlanti è descritto come sperimentale.
Cosa cambia concretamente con la trascrizione intelligente
Vengono elencate quattro funzionalità, che rappresentano la differenza pratica rispetto a una semplice trascrizione.
Pulizia delle disfluenze. Il modello gestisce le autocorrezioni come "incontriamoci martedì—no, mercoledì", rimuove le parole di riempimento e formatta automaticamente l'output.
Vocabolario personalizzato. È possibile fornire i propri termini in modo che il gergo specialistico e le grafie insolite non vadano persi nel processo.
Accuratezza alfanumerica. Google evidenzia in particolare le "entità alfanumeriche come codici postali e ID ordine", ambiti in cui i modelli generici tendono a fallire.
Copertura linguistica. Il modello rileva automaticamente oltre 85 lingue, inclusi accenti regionali e dialetti.
Vale la pena menzionare anche la funzionalità di function-calling. Google afferma che il modello "può delegare compiti complessi (come la generazione di immagini e l'analisi dei file) ad altri modelli Gemini tramite chiamate di funzione". Questa funzionalità è attualmente indicata solo per l'app Gemini per macOS.
Dove è possibile utilizzarlo oggi
Non si tratta di un rilascio limitato alle sole API, il che è insolito per il lancio di un modello.
| Piattaforma | Cosa fa lì |
|---|---|
| Gemini API in Google AI Studio | Modalità di sviluppo, inclusa la programmazione di app tramite comando vocale |
| Gemini Enterprise Agent Platform | Stesso modello, percorso di implementazione aziendale |
| Gboard su Android | La funzionalità Rambler trasforma il parlato in testo formattato |
| App Gemini su macOS | Comandi vocali abbinati al contesto dello schermo |
| Google Antigravity | Trascrizione che utilizza il contesto dello schermo e la cronologia della chat |
| Chrome | Indicato come in arrivo, per digitare tramite comando vocale in qualsiasi campo |
La descrizione per macOS è quella che si avvicina di più al comportamento di un agente. Google afferma che il modello rende semplicissimo "riassumere file locali, riutilizzare testo tra diverse app o generare immagini direttamente dove si trova il cursore". Tutto questo funziona esclusivamente tramite comando vocale.
Diverse piattaforme di sviluppo sono state menzionate come basate sulla Live API, tra cui LangChain, LiveKit, Pipecat e Vercel.
C'è un dettaglio sull'accesso che potrebbe facilmente sfuggire. I due percorsi API hanno ID modello e punti di ingresso separati. Di conseguenza, una build per i sottotitoli in tempo reale e una per l'archivio delle riunioni costituiscono due integrazioni distinte, non una sola.
Cosa non copre l'annuncio
Questo è il punto in cui una semplice trascrizione non basta più, ed è un limite che vale la pena esporre chiaramente anziché lasciare spazio a congetture.
La pagina dell'annuncio descrive un output di testo. Non descrive la produzione di un foglio di calcolo, un grafico, una presentazione o un report scritto a partire dall'audio. Le parole foglio di calcolo, Excel, CSV, slide, presentazione, report e dashboard non compaiono in alcun punto.
Ciò che descrive, invece, è la delega: il modello affida l'analisi dei file e la generazione di immagini ad altri modelli Gemini. Di conseguenza, il documento finale viene assemblato altrove e da un altro strumento.
Si tratta di una struttura logica. È anche il motivo per cui una buona trascrizione non conclude del tutto il lavoro relativo a una riunione.
Trasformare una trascrizione in un documento pronto da inviare
Una trascrizione registra ciò che è stato detto. Il verbale di una riunione, di solito, richiede altri tre elementi: i numeri mostrati sullo schermo, le decisioni prese e l'assegnazione dei compiti successivi.
Powerdrill Bloom si colloca proprio in questa seconda fase. È possibile caricare l'audio e il file oggetto della riunione, per poi descrivere in linguaggio naturale il risultato che si desidera ottenere.
La pagina relativa allo speech to text elenca i caricamenti audio in formato .mp3, .mp4, .m4a, .webm e diversi altri. Indica che la funzionalità "ottiene trascrizioni, riassunti e punti chiave dal vostro audio in pochi secondi".
Per essere onesti riguardo ai limiti inversi: quella pagina non descrive l'attribuzione del parlante, i timestamp a livello di parola o lo streaming in tempo reale. Queste sono esattamente le funzionalità rilasciate da Google. Se avete bisogno di un output con diarizzazione e timestamp per una chiamata a tre, il nuovo modello è lo strumento più adatto per questa fase.
Il punto in cui i due strumenti smettono di sovrapporsi è il documento finale. La pagina dell'AI report generator illustra come trasformare i file sorgente in un report scritto, e l'output in formato documento Office è incluso nel piano Pro.
Alternative da conoscere
Se il vostro obiettivo è ottenere verbali di riunione piuttosto che interfacce vocali, esistono altre tre strade.
Il riepilogo integrato della piattaforma di riunione. Microsoft Teams raccoglie la registrazione, i file condivisi, le note, l'ordine del giorno e le attività di follow-up in un unico posto dopo ogni evento registrato. Le funzionalità di riepilogo intelligente richiedono Teams Premium o una licenza Copilot.
Un assistente per le note dedicato. Questi strumenti partecipano alla chiamata, producono un riassunto e conservano il verbale all'interno del proprio prodotto. Ottimo quando la riunione stessa costituisce il documento finale.
Output di testo più il file sorgente. Più lento da configurare, ma è l'unica strada in cui i numeri nel report finale provengono dall'esportazione dei dati anziché da qualcuno che li legge ad alta voce.
La scelta dipende da una sola domanda: la parte di valore della riunione è ciò che le persone hanno detto o ciò che i dati hanno mostrato? Le prime tre strade rispondono bene alla prima esigenza. Solo l'ultima risponde alla seconda.
Dalla trascrizione al documento finale
Gemini 3.5 Transcribe rappresenta un vero passo avanti su un problema specifico. Un testo più pulito, l'attribuzione fino a tre parlanti, i timestamp a livello di parola e oltre 85 lingue riducono il lavoro di editing che un tempo seguiva ogni registrazione.
Ciò che non fa è stabilire cosa abbia prodotto la riunione. Questo dipende ancora dai dati alla base della discussione, motivo per cui la trascrizione e il file sorgente dovrebbero trovarsi nello stesso posto.
Il nostro confronto con Gemini Deep Research copre l'aspetto di ricerca della stessa questione. Per trasformare una registrazione e il suo file sorgente in un riepilogo completo, prova Powerdrill Bloom.
Le informazioni qui riportate sono aggiornate al 31 agosto 2026, tratte dalla pagina dell'annuncio di Google.
Domande frequenti
Cos'è Gemini 3.5 Transcribe?
È il modello speech-to-text di Google annunciato il 26 agosto 2026. Google lo descrive come il suo modello speech-to-text più preciso di sempre, in grado di convertire l'audio grezzo in un testo rifinito e formattato.
Quanto è accurato Gemini 3.5 Transcribe?
Google dichiara un Word Error Rate medio del 4.0% per lo streaming e del 2.6% per i casi d'uso non in streaming, secondo le misurazioni di Artificial Analysis. Sul benchmark FLEURS i dati sono del 5.50% e del 5.04%.
Quanti parlanti può identificare?
Fino a tre parlanti nell'audio preregistrato, con timestamp. Google descrive il supporto per più di tre parlanti come sperimentale.
Come posso accedere a Gemini 3.5 Transcribe?
Tramite la Gemini API in Google AI Studio e la Gemini Enterprise Agent Platform. Gestisce inoltre le funzionalità vocali in Gboard su Android, nell'app Gemini su macOS e in Google Antigravity, mentre per Chrome il rilascio è indicato come imminente.
Scrive il riassunto della riunione al posto mio?
L'annuncio descrive la trascrizione e la delega ad altri modelli Gemini piuttosto che la creazione di documenti finiti. Produrre un verbale scritto con i dati sottostanti è un passaggio separato, che richiede sia il file sorgente sia l'audio.