Super Sale WeekClaude Skills — 20% OFF
News

Gemini 3.5 Transcribe: Biên bản cuộc họp, Quyền truy cập và Các giải pháp thay thế (2026)

Powerdrill Bloom·
Gemini 3.5 Transcribe: Biên bản cuộc họp, Quyền truy cập và Các giải pháp thay thế (2026)

Google đã giới thiệu Gemini 3.5 Transcribe vào ngày 26 tháng 8 năm 2026. Đây là một mô hình chuyển đổi giọng nói thành văn bản giúp chuyển đổi âm thanh thô thành văn bản được định dạng, với tính năng nhận diện người nói và dấu mốc thời gian theo từng từ trên các tệp đã ghi âm trước. Hướng dẫn này sẽ đề cập đến những tính năng đã được ra mắt, nơi bạn có thể sử dụng nó và những gì cần phải thực hiện trước khi một bản ghi chép trở thành thứ mà bạn có thể gửi đi.

Những gì Google đã công bố vào ngày 26 tháng 8

Thông báo này ngắn gọn và cụ thể. Google gọi đây là "mô hình chuyển đổi giọng nói thành văn bản chính xác nhất của chúng tôi từ trước đến nay, được thiết kế cho các tương tác bằng giọng nói thông minh."

Cách tiếp cận này trái ngược với các công nghệ nhận dạng giọng nói cũ hơn. Theo thông báo của Google, các mô hình truyền thống "gặp khó khăn với tiếng ồn nền, thuật ngữ chuyên ngành phức tạp và việc loại bỏ các từ thừa, ngập ngừng." Với mô hình này, Google cho biết nó "chuyển đổi trực tiếp âm thanh thô thành văn bản chính xác, trau chuốt và được định dạng."

Hai số liệu về độ chính xác đã được công bố. Theo đo lường của Artificial Analysis, mô hình đạt Tỷ lệ lỗi từ (Word Error Rate) trung bình là 4.0% cho phát trực tiếp (streaming)2.6% cho các trường hợp sử dụng không phát trực tiếp (non-streaming).

Google cũng so sánh nó với Chirp 3, mô hình được sử dụng trước đó. Thời gian cho ra kết quả cuối cùng "cải thiện 70%," và trên thang đo FLEURS, mô hình ghi nhận tỷ lệ WER là 5.50% khi phát trực tiếp và 5.04% khi không phát trực tiếp.

Những con số đó không quan trọng bằng định dạng của kết quả đầu ra. Một tệp văn bản thô sạch hơn đồng nghĩa với việc ít phải chỉnh sửa hơn trước khi bất kỳ ai cũng có thể sử dụng.

Hai cách thức mô hình được cung cấp

Có hai API riêng biệt, và sự phân chia này rất quan trọng nếu trường hợp sử dụng của bạn là các cuộc họp.

Chế độ Model ID Mục đích thiết kế
Phát trực tiếp theo thời gian thực gemini-3.5-transcribe-live Phát trực tiếp hai chiều liên tục với độ trễ dưới một giây, thông qua Live API
Âm thanh ghi âm sẵn gemini-3.5-transcribe Âm thanh đã ghi âm, các cuộc họp và nhật ký cuộc gọi, thông qua Interactions API

Tùy chọn âm thanh ghi âm sẵn là tùy chọn mang lại các tính năng phục vụ cuộc họp. Google mô tả nó giúp ghi chép "âm thanh đã ghi âm, các cuộc họp, nhật ký cuộc gọi và nhiều hơn thế nữa với tính năng nhận diện người nói và dấu mốc thời gian theo từng từ."

Tính năng hỗ trợ nhận diện người nói có giới hạn được công bố. Mô hình "nhận diện chính xác lời thoại trong âm thanh ghi âm sẵn kèm theo dấu mốc thời gian cho tối đa ba người nói," và việc hỗ trợ trên ba người nói được mô tả là đang trong giai đoạn thử nghiệm.

Những thay đổi thực tế mà tính năng ghi chép thông minh mang lại

Bốn khả năng được liệt kê dưới đây chính là sự khác biệt thực tế so với một bản ghi chép thông thường.

Loại bỏ từ thừa và ngập ngừng. Mô hình xử lý các lỗi tự sửa lỗi khi nói như "hãy gặp nhau vào thứ Ba—không, thứ Tư," loại bỏ các từ đệm và tự động định dạng kết quả đầu ra.

Từ vựng tùy chỉnh. Bạn có thể cung cấp các thuật ngữ của riêng mình để các thuật ngữ chuyên ngành và cách đánh vần khác lạ không bị mất đi trong quá trình xử lý.

Độ chính xác của ký tự chữ và số. Google đặc biệt nhấn mạnh đến "các thực thể chữ và số như mã bưu chính và mã đơn hàng," vốn là những điểm mà các mô hình thông thường thường gặp lỗi.

Hỗ trợ ngôn ngữ. Mô hình tự động phát hiện hơn 85 ngôn ngữ, bao gồm cả giọng vùng miền và tiếng địa phương.

Ngoài ra còn có một khả năng gọi hàm (function-calling) đáng chú ý. Google cho biết mô hình "giao phó các tác vụ phức tạp (chẳng hạn như tạo hình ảnh và phân tích tệp) cho các mô hình Gemini khác thông qua các lệnh gọi hàm." Khả năng đó hiện chỉ được liệt kê cho ứng dụng Gemini trên macOS.

Nơi bạn có thể sử dụng tính năng này ngay hôm nay

Đây không phải là một bản phát hành chỉ dành cho API, điều vốn khá bất thường đối với việc ra mắt một mô hình.

Nền tảng Vai trò tại đó
Gemini API trong Google AI Studio Chế độ xây dựng, bao gồm cả việc lập trình ứng dụng bằng giọng nói
Gemini Enterprise Agent Platform Cùng một mô hình, lộ trình triển khai cho doanh nghiệp
Gboard trên Android Tính năng Rambler chuyển đổi giọng nói thành văn bản được định dạng
Ứng dụng Gemini trên macOS Các lệnh bằng giọng nói kết hợp với ngữ cảnh màn hình
Google Antigravity Ghi chép sử dụng ngữ cảnh màn hình và lịch sử trò chuyện
Chrome Được mô tả là sắp ra mắt, dùng để nhập liệu bằng giọng nói trong bất kỳ trường thông tin nào

Mô tả trên macOS mang tính chất của một trợ lý (agent) rõ rệt nhất trong số các nền tảng. Google cho biết mô hình giúp việc "tóm tắt các tệp cục bộ, tái sử dụng văn bản trên các ứng dụng hoặc tạo hình ảnh ngay tại vị trí con trỏ chuột" trở nên dễ dàng hơn bao giờ hết. Tất cả những điều đó đều hoạt động chỉ bằng giọng nói.

Một số nền tảng dành cho nhà phát triển được nêu tên là đang xây dựng trên Live API, bao gồm LangChain, LiveKit, Pipecat và Vercel.

Có một lưu ý về quyền truy cập rất dễ bị bỏ qua. Hai lộ trình API có các model ID riêng biệt và các điểm truy cập riêng biệt. Do đó, một bản dựng phụ đề trực tiếp và một bản dựng lưu trữ cuộc họp là hai tích hợp khác nhau, chứ không phải một.

Những điều thông báo không đề cập đến

Đây là lúc một bản ghi chép không còn đủ đáp ứng nhu cầu, và khoảng trống này cần được nêu rõ ràng thay vì phải phỏng đoán.

Trang thông báo mô tả kết quả đầu ra dạng văn bản. Nó không mô tả việc tạo ra một bảng tính, biểu đồ, bản trình bày (deck) hay báo cáo bằng văn bản từ âm thanh. Các từ bảng tính, Excel, CSV, slide, deck, báo cáo và bảng điều khiển (dashboard) không xuất hiện ở bất kỳ đâu trên trang đó.

Những gì nó thực sự mô tả là sự ủy thác: mô hình chuyển giao việc phân tích tệp và tạo hình ảnh cho các mô hình Gemini khác. Vì vậy, sản phẩm bàn giao được lắp ghép ở một nơi khác, bởi một công cụ khác.

Đó là một thiết kế hợp lý. Đó cũng là lý do tại sao một bản ghi chép tốt vẫn chưa thể hoàn thiện toàn bộ quy trình của một cuộc họp.

Biến bản ghi chép thành thứ bạn có thể gửi đi

Một bản ghi chép ghi lại những gì đã được nói. Một biên bản cuộc họp thường cần thêm ba điều nữa: các số liệu hiển thị trên màn hình, các quyết định và ai là người chịu trách nhiệm cho công việc tiếp theo.

Powerdrill Bloom đảm nhận phần việc thứ hai đó. Bạn tải lên tệp âm thanh và tệp tài liệu thực tế của cuộc họp, sau đó mô tả bằng ngôn ngữ tự nhiên những gì bạn muốn nhận được từ đó.

Trang speech to text liệt kê các tệp âm thanh tải lên dưới dạng .mp3, .mp4, .m4a, .webm và một số định dạng khác. Trang này cho biết tính năng này "nhận bản ghi chép, bản tóm tắt và các ý chính từ âm thanh của bạn chỉ trong vài giây."

Để công bằng về ranh giới theo chiều ngược lại: trang đó không mô tả tính năng nhận diện người nói, dấu mốc thời gian theo từng từ hay phát trực tiếp theo thời gian thực. Đó chính xác là những gì Google đã ra mắt. Nếu bạn cần kết quả đầu ra được phân vai người nói, có gắn mốc thời gian từ một cuộc gọi ba người, mô hình mới là công cụ tốt hơn cho bước đó.

Điểm mà hai công cụ này ngừng chồng chéo chính là thành phẩm (artifact). Trang AI report generator đề cập đến việc chuyển đổi các tệp nguồn thành một báo cáo bằng văn bản, và kết quả đầu ra dưới dạng tài liệu Office được liệt kê trong gói Pro.

Các giải pháp thay thế đáng cân nhắc

Nếu mục tiêu của bạn là biên bản cuộc họp thay vì giao diện giọng nói, có ba lộ trình khác đang tồn tại.

Bản tóm tắt riêng của nền tảng họp trực tuyến. Microsoft Teams thu thập bản ghi âm, các tệp được chia sẻ, ghi chú, chương trình họp và các nhiệm vụ tiếp theo tại một nơi sau bất kỳ sự kiện nào được ghi lại. Các tính năng tóm tắt thông minh yêu cầu gói Teams Premium hoặc giấy phép Copilot.

Trợ lý ghi chú chuyên dụng. Các công cụ này tham gia vào cuộc gọi, tạo bản tóm tắt và lưu trữ biên bản ngay trong sản phẩm của họ. Giải pháp này tốt khi bản thân cuộc họp chính là thành phẩm.

Kết quả văn bản kết hợp với tệp nguồn của bạn. Thiết lập chậm hơn, nhưng là lộ trình duy nhất mà các con số trong báo cáo được lấy từ tệp xuất ra thay vì từ việc ai đó đọc to chúng lên.

Lựa chọn nào phù hợp phụ thuộc vào một câu hỏi duy nhất: phần giá trị của cuộc họp là những gì mọi người đã nói, hay những gì dữ liệu đã thể hiện? Ba lộ trình đầu tiên phục vụ tốt cho vế trước. Chỉ có lộ trình cuối cùng phục vụ tốt cho vế sau.

Từ bản ghi chép đến sản phẩm bàn giao

Gemini 3.5 Transcribe là một bước tiến thực sự cho một vấn đề cụ thể. Văn bản sạch hơn, nhận diện tối đa ba người nói, dấu mốc thời gian theo từng từ và hơn 85 ngôn ngữ đều giúp giảm bớt công đoạn chỉnh sửa vốn thường phải làm sau mỗi lần ghi âm.

Những gì nó không làm được là quyết định xem cuộc họp đã tạo ra kết quả gì. Điều đó vẫn đến từ dữ liệu đằng sau cuộc thảo luận, đó là lý do tại sao bản ghi chép và tệp nguồn nên được đặt cùng một nơi.

Bài viết so sánh của chúng tôi với Gemini Deep Research đề cập đến khía cạnh nghiên cứu của cùng một câu hỏi. Để chuyển đổi một bản ghi âm và tệp nguồn của nó thành một bản tóm tắt hoàn chỉnh, hãy dùng thử Powerdrill Bloom.

Các thông tin thực tế ở đây được cập nhật tính đến ngày 31 tháng 8 năm 2026, từ trang thông báo của Google.

Câu hỏi thường gặp

Gemini 3.5 Transcribe là gì?

Đây là mô hình chuyển đổi giọng nói thành văn bản của Google được công bố vào ngày 26 tháng 8 năm 2026. Google mô tả đây là mô hình chuyển đổi giọng nói thành văn bản chính xác nhất của họ từ trước đến nay, giúp chuyển đổi âm thanh thô thành văn bản trau chuốt, được định dạng.

Gemini 3.5 Transcribe chính xác đến mức nào?

Google công bố Tỷ lệ lỗi từ (Word Error Rate) trung bình là 4.0% cho phát trực tiếp và 2.6% cho các trường hợp sử dụng không phát trực tiếp, theo đo lường của Artificial Analysis. Trên thang đo FLEURS, các con số này lần lượt là 5.50% và 5.04%.

Mô hình có thể nhận diện được bao nhiêu người nói?

Tối đa ba người nói trong âm thanh ghi âm sẵn, kèm theo dấu mốc thời gian. Google mô tả việc hỗ trợ cho nhiều hơn ba người nói là đang trong giai đoạn thử nghiệm.

Làm cách nào để tôi truy cập Gemini 3.5 Transcribe?

Thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform. Nó cũng hỗ trợ các tính năng giọng nói trong Gboard trên Android, ứng dụng Gemini trên macOS và Google Antigravity, với Chrome được mô tả là sắp ra mắt.

Mô hình này có tự viết bản tóm tắt cuộc họp cho tôi không?

Thông báo mô tả tính năng ghi chép và ủy thác cho các mô hình Gemini khác thay vì tạo ra các tài liệu hoàn chỉnh. Việc tạo ra một biên bản bằng văn bản với các số liệu cơ bản là một bước riêng biệt, và nó cần cả tệp nguồn cũng như âm thanh.