Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe: Transkrypcje spotkań, dostęp i alternatywy (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe: Transkrypcje spotkań, dostęp i alternatywy (2026)

Google wprowadziło Gemini 3.5 Transcribe 26 sierpnia 2026 roku. Jest to model zamiany mowy na tekst, który przekształca surowy dźwięk w sformatowany tekst, oferując przypisywanie mówców oraz znaczniki czasu na poziomie słów w nagranych plikach. Ten przewodnik omawia, co zostało wydane, gdzie można z tego korzystać i co jeszcze musi się wydarzyć, zanim transkrypcja stanie się czymś, co można wysłać.

Co Google ogłosiło 26 sierpnia

Ogłoszenie jest krótkie i konkretne. Google nazywa go „naszym najbardziej precyzyjnym modelem zamiany mowy na tekst do tej pory, zaprojektowanym z myślą o inteligentnych interakcjach głosowych”.

Sposób ujęcia tematu kontrastuje ze starszymi technologiami rozpoznawania mowy. Według ogłoszenia Google tradycyjne modele „zmagają się z szumem tła, skomplikowanym żargonem i oczyszczaniem wypowiedzi z pauz wahania”. Ten model, jak twierdzi Google, „konwertuje surowy dźwięk bezpośrednio na dokładny, dopracowany i sformatowany tekst”.

Opublikowano dwa wskaźniki dokładności. Według pomiarów Artificial Analysis model osiąga średni wskaźnik błędu słów (Word Error Rate) na poziomie 4,0% dla przesyłania strumieniowego oraz 2,6% dla zastosowań bez przesyłania strumieniowego.

Google porównuje go również do Chirp 3, modelu używanego wcześniej. Czas do uzyskania ostatecznego wyniku „skraca się o 70%”, a w teście porównawczym FLEURS model odnotowuje WER na poziomie 5,50% przy przesyłaniu strumieniowym i 5,04% bez przesyłania strumieniowego.

Te liczby mają jednak mniejsze znaczenie niż format wyniku. Czystszy surowy plik tekstowy oznacza mniej edycji, zanim ktokolwiek będzie mógł go użyć.

Dwa sposoby oferowania modelu

Dostępne są dwa oddzielne interfejsy API, a ten podział ma znaczenie, jeśli Twoim zastosowaniem są spotkania.

Tryb Identyfikator modelu Przeznaczenie
Przesyłanie strumieniowe w czasie rzeczywistym gemini-3.5-transcribe-live Ciągłe dwukierunkowe przesyłanie strumieniowe z opóźnieniem poniżej sekundy, za pośrednictwem Live API
Nagrany dźwięk gemini-3.5-transcribe Nagrany dźwięk, spotkania i rejestry połączeń, za pośrednictwem Interactions API

Ścieżka dla nagranego dźwięku to ta, która zawiera funkcje przydatne podczas spotkań. Google opisuje ją jako transkrypcję „nagranego dźwięku, spotkań, rejestrów połączeń i innych materiałów z przypisywaniem mówców oraz znacznikami czasu na poziomie słów”.

Obsługa wielu mówców ma określony limit. Model „dokładnie przypisuje wypowiedzi w nagranym dźwięku ze znacznikami czasu dla maksymalnie trzech mówców”, a obsługa powyżej trzech osób jest określana jako eksperymentalna.

Co naprawdę zmienia inteligentna transkrypcja

Wymieniono cztery możliwości, które stanowią praktyczną różnicę w porównaniu ze zwykłą transkrypcją.

Oczyszczanie wypowiedzi z pauz wahania. Model radzi sobie z autokorektami, takimi jak „spotkajmy się we wtorek – nie, w środę”, usuwa słowa-wypełniacze i automatycznie formatuje wynik.

Własne słownictwo. Możesz dostarczyć własne terminy, dzięki czemu specjalistyczny żargon i nietypowa pisownia nie zostaną utracone w procesie.

Dokładność alfanumeryczna. Google wyróżnia „podmioty alfanumeryczne, takie jak kody pocztowe i identyfikatory zamówień”, na których ogólne modele zazwyczaj się wybijają.

Obsługa języków. Model automatycznie wykrywa ponad 85 języków, w tym regionalne akcenty i dialekty.

Warto również zwrócić uwagę na funkcję wywoływania funkcji (function-calling). Google twierdzi, że model „może delegować złożone zadania (takie jak generowanie obrazów i analiza plików) do innych modeli Gemini za pomocą wywołań funkcji”. Ta funkcja jest obecnie wymieniona wyłącznie dla aplikacji Gemini na system macOS.

Gdzie można z tego korzystać już dziś

Nie jest to premiera ograniczona wyłącznie do API, co jest nietypowe dla debiutu nowego modelu.

Miejsce Co tam robi
Gemini API w Google AI Studio Tryb budowania, w tym kodowanie aplikacji za pomocą głosu
Gemini Enterprise Agent Platform Ten sam model, ścieżka wdrożenia korporacyjnego
Gboard na Androidzie Funkcja Rambler zamienia mowę w sformatowany tekst
Aplikacja Gemini na macOS Polecenia głosowe połączone z kontekstem ekranu
Google Antigravity Transkrypcja wykorzystująca kontekst ekranu i historię czatu
Chrome Opisane jako funkcja, która pojawi się wkrótce, do pisania głosowego w dowolnym polu

Opis dla systemu macOS najbardziej przypomina działanie agenta. Google twierdzi, że model pozwala bez wysiłku „podsumowywać lokalne pliki, ponownie wykorzystywać tekst w różnych aplikacjach lub generować obrazy bezpośrednio przy kursorze”. Wszystko to odbywa się wyłącznie za pomocą głosu.

Wymieniono kilka platform programistycznych, które bazują na Live API, w tym LangChain, LiveKit, Pipecat oraz Vercel.

Łatwo przeoczyć jedną kwestię dotyczącą dostępu. Obie ścieżki API mają oddzielne identyfikatory modeli i oddzielne punkty wejścia. Wdrożenie napisów na żywo oraz wdrożenie archiwum spotkań to zatem dwie integracje, a nie jedna.

Czego ogłoszenie nie obejmuje

W tym miejscu sama transkrypcja przestaje wystarczać, a tę lukę warto opisać wprost, zamiast snuć domysły.

Strona z ogłoszeniem opisuje wynik tekstowy. Nie opisuje tworzenia arkusza kalkulacyjnego, wykresu, prezentacji ani pisemnego raportu z nagrania audio. Słowa arkusz kalkulacyjny, Excel, CSV, slajd, prezentacja, raport i pulpit nawigacyjny nie pojawiają się na niej ani razu.

Opisuje natomiast delegowanie zadań: model przekazuje analizę plików i generowanie obrazów do innych modeli Gemini. Zatem końcowy produkt jest tworzony gdzie indziej i przez coś innego.

To rozsądne rozwiązanie projektowe. Jest to również powód, dla którego dobra transkrypcja nie zamyka w pełni tematu podsumowania spotkania.

Przekształcanie transkrypcji w coś, co można wysłać

Transkrypcja rejestruje to, co zostało powiedziane. Podsumowanie spotkania zazwyczaj wymaga jeszcze trzech rzeczy: liczb, które były widoczne na ekranie, podjętych decyzji oraz informacji o tym, kto odpowiada za kolejne kroki.

Powerdrill Bloom zajmuje się tą drugą częścią. Przesyłasz nagranie audio oraz plik, którego dotyczyło spotkanie, a następnie opisujesz w języku naturalnym, co chcesz z tego uzyskać.

Strona speech to text wymienia przesyłanie plików audio w formatach .mp3, .mp4, .m4a, .webm i kilku innych. Informuje, że funkcja ta „pobiera transkrypcje, podsumowania i główne punkty z Twojego nagrania w kilka sekund”.

Będąc uczciwym co do granicy w drugą stronę: tamta strona nie opisuje przypisywania mówców, znaczników czasu na poziomie słów ani przesyłania strumieniowego w czasie rzeczywistym. To są dokładnie te funkcje, które wprowadziło Google. Jeśli potrzebujesz podzielonego na role, opatrzonego znacznikami czasu wyniku z rozmowy trzech osób, nowy model jest lepszym narzędziem do tego kroku.

Miejscem, w którym te dwa rozwiązania przestają się pokrywać, jest końcowy produkt. Strona AI report generator opisuje przekształcanie plików źródłowych w pisemny raport, a generowanie dokumentów pakietu Office jest dostępne w planie Pro.

Alternatywy, które warto znać

Jeśli Twoim celem jest tworzenie podsumowań spotkań, a nie interfejsy głosowe, istnieją trzy inne ścieżki.

Własne podsumowanie Twojej platformy konferencyjnej. Microsoft Teams gromadzi nagranie, udostępnione pliki, notatki, agendę i zadania do wykonania w jednym miejscu po każdym nagranym wydarzeniu. Funkcje inteligentnego podsumowania wymagają licencji Teams Premium lub Copilot.

Dedykowany asystent do notatek. Narzędzia te uczestniczą w rozmowie, generują podsumowanie i przechowują zapis wewnątrz własnego produktu. To dobre rozwiązanie, gdy samo spotkanie jest końcowym produktem.

Wynik tekstowy plus Twój plik źródłowy. Wolniejsze w konfiguracji, ale to jedyna ścieżka, w której liczby w podsumowaniu pochodzą z eksportu danych, a nie z tego, że ktoś odczytał je na głos.

To, które rozwiązanie jest odpowiednie, zależy od jednego pytania: czy najcenniejszą częścią spotkania było to, co ludzie mówili, czy to, co pokazały dane? Pierwsze trzy ścieżki dobrze służą temu pierwszemu celowi. Tylko ostatnia służy temu drugiemu.

Od transkrypcji do gotowego produktu

Gemini 3.5 Transcribe to realny krok naprzód w rozwiązywaniu konkretnego problemu. Czystszy tekst, przypisywanie trzech mówców, znaczniki czasu na poziomie słów i ponad 85 języków – wszystko to ogranicza potrzebę edycji, która dawniej następowała po każdym nagraniu.

Model ten nie decyduje jednak o tym, co powstało w wyniku spotkania. To nadal wynika z danych stojących za dyskusją, dlatego transkrypcja i plik źródłowy powinny znajdować się w tym samym miejscu.

Nasze porównanie z Gemini Deep Research obejmuje badawczą stronę tego samego zagadnienia. Aby przekształcić nagranie i jego plik źródłowy w gotowe podsumowanie, wypróbuj Powerdrill Bloom.

Przedstawione tu fakty są aktualne na dzień 31 sierpnia 2026 roku i pochodzą ze strony z ogłoszeniem Google.

Najczęściej zadawane pytania

Czym jest Gemini 3.5 Transcribe?

To model zamiany mowy na tekst firmy Google, ogłoszony 26 sierpnia 2026 roku. Google opisuje go jako swój najbardziej precyzyjny model zamiany mowy na tekst do tej pory, który konwertuje surowy dźwięk w dopracowany, sformatowany tekst.

Jak dokładny jest Gemini 3.5 Transcribe?

Google podaje średni wskaźnik błędu słów (Word Error Rate) na poziomie 4,0% dla przesyłania strumieniowego i 2,6% dla zastosowań bez przesyłania strumieniowego, zgodnie z pomiarami Artificial Analysis. W teście porównawczym FLEURS wartości te wynoszą odpowiednio 5,50% i 5,04%.

Ilu mówców potrafi zidentyfikować?

Do trzech mówców w nagranym dźwięku, wraz ze znacznikami czasu. Google opisuje obsługę więcej niż trzech mówców jako eksperymentalną.

Jak mogę uzyskać dostęp do Gemini 3.5 Transcribe?

Za pośrednictwem Gemini API w Google AI Studio oraz Gemini Enterprise Agent Platform. Obsługuje również funkcje głosowe w Gboard na Androidzie, aplikacji Gemini na macOS oraz Google Antigravity, przy czym Chrome jest opisywany jako rozwiązanie, które pojawi się wkrótce.

Czy model napisze za mnie podsumowanie spotkania?

Ogłoszenie opisuje transkrypcję i delegowanie zadań do innych modeli Gemini, a nie gotowe dokumenty. Tworzenie pisemnego zapisu wraz z powiązanymi liczbami to osobny krok, który wymaga zarówno pliku źródłowego, jak i nagrania audio.