Gemini 3.5 Transcribe: 회의 녹취록, 액세스 및 대안 (2026)

Google은 2026년 8월 26일에 Gemini 3.5 Transcribe를 출시했습니다. 이는 원시 오디오를 포맷팅된 텍스트로 변환하는 음성 인식(speech-to-text) 모델로, 사전 녹음된 파일에 대해 화자 구분(speaker attribution) 및 단어 수준의 타임스탬프 기능을 제공합니다. 이 가이드에서는 출시된 기능, 사용 가능한 플랫폼, 그리고 전송 가능한 수준의 녹취록을 완성하기 위해 추가로 필요한 작업에 대해 다룹니다.
Google이 8월 26일에 발표한 내용
이번 발표는 짧고 구체적입니다. Google은 이를 "지능형 음성 상호작용을 위해 설계된, 역대 가장 정밀한 음성 인식 모델"이라고 부릅니다.
이러한 프레임은 기존의 음성 인식 기술과 대조를 이룹니다. Google의 발표에 따르면, 기존 모델은 "배경 소음, 복잡한 전문 용어, 그리고 말더듬 정리에 어려움을 겪습니다." 반면 이번 모델은 "원시 오디오를 정확하고 다듬어진 포맷팅된 텍스트로 직접 변환한다"고 Google은 설명합니다.
두 가지 정확도 수치가 공개되었습니다. Artificial Analysis의 측정에 따르면, 이 모델은 스트리밍의 경우 4.0%, 비스트리밍의 경우 2.6%의 평균 단어 오류율(Word Error Rate)을 기록했습니다.
Google은 또한 이 모델을 이전 모델인 Chirp 3와 비교했습니다. 최종 출력까지 걸리는 시간이 "70% 향상"되었으며, FLEURS 벤치마크에서는 스트리밍 5.50% WER, 비스트리밍 5.04% WER을 기록했습니다.
이러한 수치보다 더 중요한 것은 결과물의 형식입니다. 더 깔끔한 원시 텍스트 파일은 누군가 사용하기 전에 편집할 필요가 줄어든다는 것을 의미합니다.
모델이 제공되는 두 가지 방식
두 개의 개별 API가 존재하며, 회의록 작성이 목적이라면 이 구분이 매우 중요합니다.
| 모드 | 모델 ID | 설계 목적 |
|---|---|---|
| 실시간 스트리밍 | gemini-3.5-transcribe-live |
Live API를 통한 1초 미만의 지연 시간을 가진 지속적인 양방향 스트리밍 |
| 사전 녹음된 오디오 | gemini-3.5-transcribe |
Interactions API를 통한 녹음된 오디오, 회의 및 통화 기록 |
사전 녹음된 오디오 경로가 회의 관련 기능을 탑재한 방식입니다. Google은 이를 "화자 구분 및 단어 수준의 타임스탬프를 포함하여 녹음된 오디오, 회의, 통화 기록 등을 전사하는 것"으로 설명합니다.
화자 지원에는 명시된 한계가 있습니다. 이 모델은 "사전 녹음된 오디오에서 최대 3명의 화자까지 타임스탬프와 함께 음성을 정확하게 구분"하며, 3명을 초과하는 화자 지원은 실험적인 기능으로 설명되어 있습니다.
스마트 전사 기능이 실제로 바꾸는 것
네 가지 기능이 나열되어 있으며, 이는 일반 녹취록과의 실질적인 차이점입니다.
말더듬 정리. 이 모델은 "화요일에 만나요—아니, 수요일에"와 같은 자가 수정을 처리하고, 불필요한 추임새(filler words)를 제거하며, 출력을 자동으로 포맷팅합니다.
사용자 지정 어휘. 고유한 용어를 직접 제공하여 전문 용어나 특이한 철자가 전사 과정에서 누락되지 않도록 할 수 있습니다.
영숫자 정확도. Google은 일반적인 모델들이 주로 실패하는 "우편번호 및 주문 ID와 같은 영숫자 개체"를 특별히 강조합니다.
지원 언어 범위. 이 모델은 지역 악센트와 방언을 포함하여 85개 이상의 언어를 자동으로 감지합니다.
주목할 만한 함수 호출(function-calling) 기능도 있습니다. Google은 이 모델이 "함수 호출을 통해 이미지 생성 및 파일 분석과 같은 복잡한 작업을 다른 Gemini 모델에 위임할 수 있다"고 설명합니다. 이 기능은 현재 Gemini macOS 앱에서만 제공되는 것으로 나와 있습니다.
현재 사용 가능한 플랫폼
모델 출시로서는 이례적으로 API 전용 출시가 아닙니다.
| 플랫폼 | 주요 기능 |
|---|---|
| Google AI Studio의 Gemini API | 음성으로 앱을 코딩하는 빌드 모드 포함 |
| Gemini Enterprise Agent Platform | 동일한 모델, 기업용 배포 경로 |
| Android의 Gboard | Rambler 기능이 음성을 포맷팅된 텍스트로 변환 |
| macOS의 Gemini 앱 | 화면 컨텍스트와 결합된 음성 명령 |
| Google Antigravity | 화면 컨텍스트와 채팅 기록을 활용한 전사 |
| Chrome | 모든 입력창에서 음성으로 타이핑할 수 있는 기능으로, 곧 출시 예정으로 설명됨 |
macOS에 대한 설명은 이 세트 중에서 가장 에이전트다운 모습을 보여줍니다. Google은 이 모델을 통해 "로컬 파일을 요약하고, 여러 앱에서 텍스트를 재사용하거나, 커서 위치에서 바로 이미지를 생성하는 것"이 매우 간편해진다고 설명합니다. 이 모든 작업이 오직 음성만으로 실행됩니다.
LangChain, LiveKit, Pipecat, Vercel을 포함한 여러 개발자 플랫폼이 Live API를 기반으로 구축 중인 것으로 언급되었습니다.
쉽게 놓칠 수 있는 액세스 관련 참고 사항이 있습니다. 두 API 경로는 서로 다른 모델 ID와 개별 진입점을 가집니다. 따라서 실시간 자막 빌드와 회의 아카이브 빌드는 하나의 통합이 아니라 두 개의 개별적인 통합 작업입니다.
이번 발표에서 다루지 않는 내용
이 부분은 단순한 녹취록만으로는 부족해지는 지점이며, 추측하기보다는 그 공백을 명확히 짚고 넘어갈 가치가 있습니다.
발표 페이지는 텍스트 출력에 대해 설명하고 있습니다. 오디오를 통해 스프레드시트, 차트, 프레젠테이션 덱 또는 서면 보고서를 생성하는 것에 대해서는 설명하지 않습니다. 스프레드시트, Excel, CSV, 슬라이드, 덱, 보고서, 대시보드라는 단어는 어디에도 등장하지 않습니다.
대신 위임에 대해 설명합니다. 즉, 모델이 파일 분석과 이미지 생성을 다른 Gemini 모델에 넘겨주는 방식입니다. 따라서 최종 결과물은 다른 곳에서, 다른 도구에 의해 조립됩니다.
이는 합리적인 설계입니다. 또한 훌륭한 녹취록만으로는 회의의 모든 과정을 완결 지을 수 없는 이유이기도 합니다.
녹취록을 전송 가능한 결과물로 바꾸기
녹취록은 발언 내용을 기록합니다. 하지만 회의 기록에는 보통 세 가지가 더 필요합니다. 화면에 표시된 수치, 결정 사항, 그리고 다음 단계에서 누가 무엇을 담당할지입니다.
Powerdrill Bloom은 바로 이 후반부 작업을 지원합니다. 오디오와 회의의 실제 주제가 담긴 파일을 업로드한 다음, 얻고자 하는 결과물을 자연어로 설명하기만 하면 됩니다.
speech to text 페이지에는 .mp3, .mp4, .m4a, .webm 및 기타 여러 형식의 오디오 업로드가 지원된다고 나와 있습니다. 또한 이 기능은 "몇 초 만에 오디오에서 녹취록, 요약, 핵심 요점을 추출한다"고 설명합니다.
반대 방향의 경계선에 대해서도 공정하게 짚고 넘어가자면, 해당 페이지는 화자 구분, 단어 수준의 타임스탬프 또는 실시간 스트리밍에 대해 설명하지 않습니다. 이것들이 바로 Google이 이번에 출시한 기능들입니다. 만약 3인 통화에서 화자가 구분되고 타임스탬프가 찍힌 출력이 필요하다면, 해당 단계에서는 이 새로운 모델이 더 적합한 도구입니다.
두 도구의 중복이 끝나는 지점은 최종 결과물(artifact)입니다. AI report generator 페이지는 소스 파일을 서면 보고서로 변환하는 방법을 다루며, Office 문서 출력은 Pro 플랜에서 제공되는 것으로 나와 있습니다.
알아둘 만한 대안들
음성 인터페이스보다 회의 기록 작성이 목적이라면 세 가지 다른 경로가 있습니다.
회의 플랫폼 자체의 요약 기능. Microsoft Teams는 녹화된 이벤트가 끝난 후 녹화본, 공유 파일, 메모, 의제, 후속 작업 등을 한곳에 모아줍니다. 지능형 요약 기능을 사용하려면 Teams Premium 또는 Copilot 라이선스가 필요합니다.
전용 노트 필기 도구. 통화에 참여하여 요약본을 생성하고 자체 제품 내에 기록을 보관합니다. 회의 자체가 결과물일 때 유용합니다.
텍스트 출력 및 소스 파일 결합. 설정하는 데 시간이 더 걸리지만, 보고서의 수치가 누군가 소리 내어 읽은 내용이 아니라 내보낸 데이터에서 직접 추출되는 유일한 경로입니다.
어떤 방식이 적합한지는 단 하나의 질문에 달려 있습니다. 회의에서 가치 있는 부분이 사람들이 말한 내용인가요, 아니면 데이터가 보여준 내용인가요? 처음 세 가지 경로는 전자에 유용합니다. 오직 마지막 경로만이 후자에 유용합니다.
녹취록에서 최종 결과물까지
Gemini 3.5 Transcribe는 특정 문제 해결에 있어 실질적인 진전을 이루었습니다. 더 깔끔한 텍스트, 3인 화자 구분, 단어 수준의 타임스탬프, 85개 이상의 언어 지원은 모두 녹음 후에 수반되던 편집 작업을 줄여줍니다.
하지만 이 모델이 회의의 결과물을 결정해 주지는 않습니다. 이는 여전히 논의의 배경이 되는 데이터에서 비롯되므로, 녹취록과 소스 파일이 같은 공간에 있어야 하는 이유입니다.
Gemini Deep Research와의 비교에서 동일한 질문의 연구 측면을 다루고 있습니다. 녹음 파일과 소스 파일을 완성된 요약본으로 변환하려면 Powerdrill Bloom을 사용해 보세요.
여기에 기재된 사실은 2026년 8월 31일 기준 Google의 발표 페이지를 바탕으로 작성되었습니다.
자주 묻는 질문
Gemini 3.5 Transcribe란 무엇인가요?
2026년 8월 26일에 발표된 Google의 음성 인식 모델입니다. Google은 이를 원시 오디오를 다듬어진 포맷팅된 텍스트로 변환하는 역대 가장 정밀한 음성 인식 모델로 설명합니다.
Gemini 3.5 Transcribe의 정확도는 어느 정도인가요?
Google은 Artificial Analysis의 측정에 따라 스트리밍의 경우 4.0%, 비스트리밍의 경우 2.6%의 평균 단어 오류율을 공개했습니다. FLEURS 벤치마크에서의 수치는 각각 5.50%와 5.04%입니다.
몇 명의 화자를 식별할 수 있나요?
사전 녹음된 오디오에서 타임스탬프와 함께 최대 3명의 화자를 식별할 수 있습니다. 3명을 초과하는 화자 지원은 실험적인 기능으로 설명되어 있습니다.
Gemini 3.5 Transcribe는 어떻게 이용할 수 있나요?
Google AI Studio의 Gemini API 및 Gemini Enterprise Agent Platform을 통해 이용할 수 있습니다. 또한 Android의 Gboard, macOS의 Gemini 앱, Google Antigravity의 음성 기능을 지원하며, Chrome은 곧 출시 예정으로 설명되어 있습니다.
회의 요약본도 대신 작성해 주나요?
발표 내용에 따르면 완성된 문서를 제공하기보다는 전사 및 다른 Gemini 모델로의 위임 기능을 설명하고 있습니다. 기초 수치가 포함된 서면 기록을 생성하는 것은 별도의 단계이며, 오디오뿐만 아니라 소스 파일도 필요합니다.