Gemini 3.5 Transcribe: стенограммы встреч, доступ и альтернативы (2026)

Google представила Gemini 3.5 Transcribe 26 августа 2026 года. Это модель преобразования речи в текст, которая превращает необработанное аудио в форматированный текст с распознаванием спикеров и временными метками на уровне слов в предварительно записанных файлах. В этом руководстве рассказывается о том, что именно было выпущено, где это можно использовать и что еще должно произойти, прежде чем стенограмма превратится в готовый к отправке документ.
Что Google анонсировала 26 августа
Анонс короткий и конкретный. Google называет ее «нашей самой точной моделью преобразования речи в текст на сегодняшний день, разработанной для интеллектуавого голосового взаимодействия».
Такое позиционирование контрастирует со старыми технологиями распознавания речи. Согласно анонсу Google, традиционные модели «испытывают трудности с фоновым шумом, сложным жаргоном и очисткой от речевых запинок». Эта же модель, по заявлению Google, «напрямую преобразует необработанное аудио в точный, чистый и отформатированный текст».
Опубликованы два показателя точности. По оценке Artificial Analysis, средний показатель Word Error Rate модели составляет 4.0% для потокового вещания и 2.6% для непотоковых сценариев использования.
Google также сравнивает ее с Chirp 3, моделью, которая использовалась ранее. Время получения конечного результата «улучшилось на 70%», а в бенчмарке FLEURS модель демонстрирует показатель WER 5.50% при потоковой передаче и 5.04% без нее.
Эти цифры имеют меньшее значение, чем формат результата. Более чистый исходный текстовый файл означает, что потребуется меньше редактирования, прежде чем его можно будет использовать.
Два способа предоставления модели
Существует два отдельных API, и это разделение имеет значение, если ваш сценарий использования — это совещания.
| Режим | Model ID | Для чего предназначена |
|---|---|---|
| Потоковая передача в реальном времени | gemini-3.5-transcribe-live |
Непрерывная двунаправленная потоковая передача с субсекундной задержкой через Live API |
| Предварительно записанное аудио | gemini-3.5-transcribe |
Записанное аудио, совещания и журналы вызовов через Interactions API |
Именно вариант с предварительной записью поддерживает функции для совещаний. Google описывает его как транскрибирование «записанного аудио, совещаний, журналов вызовов и многого другого с распознаванием спикеров и временными метками на уровне слов».
Поддержка распознавания спикеров имеет заявленное ограничение. Модель «точно определяет говорящего в предварительно записанном аудио с временными метками для максимум трех спикеров», а поддержка более трех спикеров описывается как экспериментальная.
Что на самом деле меняет умное транскрибирование
Перечислены четыре возможности, которые и составляют практическую разницу по сравнению с обычной стенограммой.
Очистка от речевых запинок. Модель справляется с самоисправлениями вроде «давайте встретимся во вторник — нет, в среду», удаляет слова-паразиты и автоматически форматирует результат.
Пользовательский словарь. Вы можете добавить свои собственные термины, чтобы специализированный жаргон и необычное написание слов сохранялись при обработке.
Точность буквенно-цифровых данных. Google особо выделяет «буквенно-цифровые сущности, такие как почтовые индексы и order IDs», на которых обычные модели часто спотыкаются.
Языковой охват. Модель автоматически распознает более 85 языков, включая региональные акценты и диалекты.
Также стоит отметить возможность вызова функций. Google заявляет, что модель «может делегировать сложные задачи (такие как генерация изображений и анализ файлов) другим моделям Gemini посредством вызовов функций». На данный момент эта возможность заявлена только для приложения Gemini для macOS.
Где это можно использовать уже сегодня
Этот релиз не ограничивается только API, что необычно для запуска новой модели.
| Платформа | Что она там делает |
|---|---|
| Gemini API в Google AI Studio | Режим сборки, включая создание кода для приложений голосом |
| Gemini Enterprise Agent Platform | Та же модель, корпоративный путь развертывания |
| Gboard на Android | Функция Rambler превращает речь в форматированный текст |
| Gemini приложение на macOS | Голосовые команды в сочетании с контекстом экрана |
| Google Antigravity | Транскрибирование с использованием контекста экрана и истории чата |
| Chrome | Заявлено как «скоро появится», для голосового ввода текста в любом поле |
Описание для macOS выглядит наиболее «агентным» из всех. Google заявляет, что модель позволяет без труда «суммировать локальные файлы, адаптировать текст в различных приложениях или генерировать изображения прямо там, где находится курсор». И все это управляется исключительно голосом.
Несколько платформ для разработчиков указаны как создающие решения на базе Live API, включая LangChain, LiveKit, Pipecat и Vercel.
Один нюанс доступа легко упустить из виду. Два пути API имеют разные model IDs и разные точки входа. Таким образом, сборка для субтитров в реальном времени и сборка для архива совещаний — это две разные интеграции, а не одна.
О чем умалчивает анонс
Именно на этом этапе одной стенограммы становится недостаточно, и этот пробел стоит обозначить прямо, а не строить догадки.
На странице анонса описывается текстовый вывод. Там не упоминается создание электронных таблиц, диаграмм, презентаций или письменных отчетов на основе аудио. Слова spreadsheet, Excel, CSV, slide, deck, report и dashboard там вообще не встречаются.
Что там действительно описывается, так это делегирование: модель передает анализ файлов и генерацию изображений другим моделям Gemini. Таким образом, итоговый результат собирается в другом месте и с помощью других инструментов.
Это вполне разумная архитектура. Но именно поэтому хорошая стенограмма сама по себе не решает всех задач по итогам совещания.
Превращение стенограммы в готовый к отправке документ
Стенограмма фиксирует то, что было сказано. Но для полноценного отчета о совещании обычно требуются еще три вещи: цифры, которые были на экране, принятые решения и то, кто и за какие задачи отвечает дальше.
Powerdrill Bloom берет на себя эту вторую часть работы. Вы загружаете аудиозапись и файл, которому было посвящено совещание, а затем на естественном языке описываете, какой результат хотите получить.
На странице преобразования речи в текст указана возможность загрузки аудио в форматах .mp3, .mp4, .m4a, .webm и некоторых других. Там говорится, что эта функция «позволяет получать стенограммы, краткие резюме и основные тезисы из вашего аудио за считанные секунды».
Справедливости ради стоит отметить и обратную сторону: на этой странице не упоминаются распознавание спикеров, временные метки на уровне слов или потоковая передача в реальном времени. А это как раз то, что выпустила Google. Если вам нужна разбитая по ролям стенограмма с временными метками для звонка с участием трех человек, новая модель будет лучшим инструментом для этого этапа.
Различие между ними начинается на этапе создания итогового документа. Страница генератора отчетов на базе ИИ посвящена превращению исходных файлов в письменный отчет, а экспорт в документы Office доступен на тарифе Pro.
Альтернативы, о которых стоит знать
Если ваша цель — отчеты о совещаниях, а не голосовые интерфейсы, существуют три других пути.
Собственные резюме вашей платформы для совещаний. Microsoft Teams собирает запись, общие файлы, заметки, повестку дня и последующие задачи в одном месте после любого записанного мероприятия. Функции интеллектуального резюме требуют наличия лицензии Teams Premium или Copilot.
Специализированный сервис для ведения заметок. Такие инструменты подключаются к звонку, создают резюме и сохраняют запись внутри своего продукта. Это удобно, когда само совещание и есть главный результат.
Текстовый вывод плюс ваш исходный файл. Этот способ требует больше времени на настройку, но это единственный путь, при котором цифры в итоговом отчете берутся непосредственно из экспортированного файла, а не из того, что кто-то зачитал вслух.
Выбор подходящего варианта зависит от одного вопроса: что важнее в совещании — то, что сказали люди, или то, что показали данные? Первые три пути отлично подходят для первого случая. И только последний — для второго.
От стенограммы к готовому результату
Gemini 3.5 Transcribe — это реальный шаг вперед в решении конкретной задачи. Более чистый текст, распознавание до трех спикеров, временные метки на уровне слов и поддержка более 85 языков — все это сокращает объем редактирования, которое раньше требовалось после каждой записи.
Чего эта модель не делает, так это не определяет, каков итог совещания. Это по-прежнему зависит от данных, стоящих за обсуждением, именно поэтому стенограмма и исходный файл должны находиться в одном месте.
В нашем сравнении с Gemini Deep Research рассматривается исследовательская сторона этого вопроса. Чтобы превратить запись и ее исходный файл в готовое резюме, попробуйте Powerdrill Bloom.
Факты, приведенные здесь, актуальны на 31 августа 2026 года и взяты со страницы анонса Google.
Часто задаваемые вопросы
Что такое Gemini 3.5 Transcribe?
Это модель преобразования речи в текст от Google, анонсированная 26 августа 2026 года. Google описывает ее как свою самую точную модель преобразования речи в текст на сегодняшний день, которая преобразует необработанное аудио в чистый, отформатированный текст.
Насколько точна Gemini 3.5 Transcribe?
Google заявляет о среднем показателе Word Error Rate на уровне 4.0% для потокового вещания и 2.6% для непотоковых сценариев использования, согласно измерениям Artificial Analysis. В бенчмарке FLEURS эти показатели составляют 5.50% и 5.04%.
Сколько спикеров она может распознать?
До трех спикеров в предварительно записанном аудио с временными метками. Поддержку более трех спикеров Google описывает как экспериментальную.
Как получить доступ к Gemini 3.5 Transcribe?
Через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Она также обеспечивает работу голосовых функций в Gboard на Android, приложения Gemini на macOS и Google Antigravity, а поддержка в Chrome заявлена как «скоро появится».
Составит ли она за меня резюме совещания?
В анонсе описывается транскрибирование и делегирование задач другим моделям Gemini, а не создание готовых документов. Подготовка письменного отчета с исходными цифрами — это отдельный шаг, для которого требуется как аудиозапись, так и исходный файл.