Gemini 3.5 Transcribe: نصوص الاجتماعات، الوصول، والبدائل (2026)

قدمت Google نموذج Gemini 3.5 Transcribe في 26 أغسطس 2026. وهو نموذج لتحويل الكلام إلى نص يقوم بتحويل الصوت الخام إلى نص منسق، مع تحديد هوية المتحدث وطوابع زمنية على مستوى الكلمة في الملفات المسجلة مسبقًا. يغطي هذا الدليل الميزات التي تم إطلاقها، وأين يمكنك استخدامها، وما الذي لا يزال يتعين حدوثه قبل أن يصبح النص المفرغ شيئًا يمكنك إرساله.
ما أعلنته Google في 26 أغسطس
الإعلان قصير ومحدد. تصفه Google بأنه "نموذجنا الأكثر دقة لتحويل الكلام إلى نص حتى الآن، والمصمم للتفاعلات الصوتية الذكية."
يأتي هذا الإطار في تباين مع تقنيات التعرف على الكلام الأقدم. ووفقًا لـ إعلان Google، فإن النماذج التقليدية "تعاني من الضوضاء الخلفية، والمصطلحات المعقدة، وتصفية التلعثم". وتقول Google إن هذا النموذج "يحول الصوت الخام مباشرة إلى نص دقيق ومصقول ومنسق".
تم نشر رقمين للدقة. وفقًا لقياسات Artificial Analysis، يصل النموذج إلى متوسط معدل خطأ في الكلمات يبلغ 4.0% للبث المباشر و 2.6% لحالات الاستخدام غير المباشر.
تقارنه Google أيضًا بنموذج Chirp 3، وهو النموذج الذي كانت تستخدمه سابقًا. حيث "يتحسن الوقت المستغرق للوصول إلى المخرجات النهائية بنسبة 70%"، وعلى مقياس FLEURS يسجل معدل خطأ في الكلمات يبلغ 5.50% للبث المباشر و 5.04% لغير المباشر.
هذه الأرقام أقل أهمية من تنسيق النتيجة. فملف النص الخام الأكثر نظافة يعني تعديلات أقل قبل أن يتمكن أي شخص من استخدامه.
الطريقتان اللتان يتوفر بهما النموذج
هناك واجهتا برمجة تطبيقات (APIs) منفصلتان، وهذا الانقسام مهم إذا كانت الاجتماعات هي حالة الاستخدام الخاصة بك.
| الوضع | معرف النموذج | الغرض الذي صُمم من أجله |
|---|---|---|
| البث المباشر في الوقت الفعلي | gemini-3.5-transcribe-live |
بث مستمر ثنائي الاتجاه بزمن استجابة أقل من الثانية، عبر Live API |
| الصوت المسجل مسبقًا | gemini-3.5-transcribe |
الصوت المسجل، والاجتماعات، وسجلات المكالمات، عبر Interactions API |
مسار الصوت المسجل مسبقًا هو المسار الذي يحمل ميزات الاجتماعات. تصفه Google بأنه يقوم بتفريغ "الصوت المسجل، والاجتماعات، وسجلات المكالمات، والمزيد مع تحديد هوية المتحدث وطوابع زمنية على مستوى الكلمة".
دعم تحديد المتحدثين له حد أقصى معلن. فالنموذج "يحدد بدقة المتحدثين في الصوت المسجل مسبقًا مع طوابع زمنية لما يصل إلى ثلاثة متحدثين"، ويُوصَف الدعم لأكثر من ثلاثة متحدثين بأنه تجريبي.
ما الذي يغيره التفريغ الصوتي الذكي فعليًا
تم إدراج أربع قدرات، وهي تمثل الفرق العملي عن التفريغ النصي العادي.
تصفية التلعثم. يتعامل النموذج مع التصحيحات الذاتية مثل "لنلتقي يوم الثلاثاء—لا، الأربعاء"، ويزيل الكلمات الحشوية، وينسق المخرجات تلقائيًا.
المفردات المخصصة. يمكنك تقديم مصطلحاتك الخاصة حتى تنجح المصطلحات المتخصصة والتهجئات غير المعتادة في المرور عبر هذه العملية.
دقة الحروف والأرقام. تخص Google بالذكر "الكيانات المكونة من حروف وأرقام مثل الرموز البريدية ومعرفات الطلبات"، وهي المجالات التي تميل النماذج العامة إلى الإخفاق فيها.
تغطية اللغات. يكتشف النموذج تلقائيًا أكثر من 85 لغة، بما في ذلك اللهجات واللكنات الإقليمية.
هناك أيضًا ميزة استدعاء الدوال (function-calling) الجديرة بالذكر. تقول Google إن النموذج "يمكنه تفويض المهام المعقدة (مثل توليد الصور وتحليل الملفات) إلى نماذج Gemini الأخرى عبر استدعاءات الدوال". هذه القدرة مدرجة حاليًا لتطبيق Gemini على نظام macOS فقط.
أين يمكنك استخدامه اليوم
هذا ليس إصدارًا مقتصرًا على واجهة برمجة التطبيقات (API) فقط، وهو أمر غير معتاد عند إطلاق النماذج.
| المنصة | ما يفعله هناك |
|---|---|
| Gemini API في Google AI Studio | وضع البناء، بما في ذلك برمجة التطبيقات بالصوت |
| Gemini Enterprise Agent Platform | نفس النموذج، مسار نشر المؤسسات |
| Gboard على Android | ميزة Rambler تحول الكلام إلى نص منسق |
| تطبيق Gemini على macOS | الأوامر الصوتية المقترنة بسياق الشاشة |
| Google Antigravity | تفريغ صوتي يستخدم سياق الشاشة وسجل الدردشة |
| Chrome | موصوف بأنه سيتوفر قريبًا، للكتابة بالصوت في أي حقل |
وصف macOS هو الأكثر شبهًا بالوكيل الذكي في هذه المجموعة. تقول Google إن النموذج يجعل من السهل للغاية "تلخيص الملفات المحلية، أو إعادة استخدام النصوص عبر التطبيقات، أو توليد الصور مباشرة عند موضع المؤشر". كل ذلك يعمل بالصوت وحده.
تم ذكر العديد من منصات المطورين التي تبني على Live API، بما في ذلك LangChain و LiveKit و Pipecat و Vercel.
هناك ملاحظة وصول يسهل إغفالها. فمسارا واجهة برمجة التطبيقات (API) لهما معرفات نماذج منفصلة ونقاط دخول منفصلة. وبالتالي، فإن بناء ميزة التعليق المباشر وبناء أرشيف الاجتماعات هما عمليتا دمج منفصلتان وليستا عملية واحدة.
ما لا يغطيه الإعلان
هذا هو الحد الذي يتوقف عنده التفريغ النصي عن كونها كافيًا، وتستحق هذه الفجوة توضيحها بصراحة بدلاً من التخمين بشأنها.
تصف صفحة الإعلان مخرجات نصية. وهي لا تصف إنتاج جدول بيانات، أو مخطط بياني، أو عرض تقديمي، أو تقرير مكتوب من الصوت. إن كلمات جدول بيانات، و Excel، و CSV، وشريحة، وعرض تقديمي، وتقرير، ولوحة معلومات لا تظهر في أي مكان فيها.
ما تصفه هو التفويض: يقوم النموذج بتسليم تحليل الملفات وتوليد الصور إلى نماذج Gemini الأخرى. وبالتالي، يتم تجميع المنتج النهائي في مكان آخر، بواسطة شيء آخر.
هذا تصميم منطقي. وهو أيضًا السبب في أن التفريغ النصي الجيد لا يكمل حلقة الاجتماع بالكامل.
تحويل التفريغ النصي إلى شيء يمكنك إرساله
يسجل التفريغ النصي ما قيل. أما سجل الاجتماع فعادةً ما يحتاج إلى ثلاثة أشياء أخرى: الأرقام التي كانت معروضة على الشاشة، والقرارات، ومن يتولى مسؤولية ماذا بعد ذلك.
يركز Powerdrill Bloom على هذا النصف الثاني. حيث تقوم بتحميل الصوت والملف الذي كان الاجتماع يدور حوله بالفعل، ثم تصف باللغة الطبيعية ما تريد الحصول عليه منه.
تعرض صفحة تحويل الكلام إلى نص عمليات تحميل الصوت بصيغ .mp3 و .mp4 و .m4a و .webm والعديد من الصيغ الأخرى. وتذكر أن الميزة "تحصل على النصوص المفرغة، والملخصات، والنقاط الرئيسية من ملفك الصوتي في ثوانٍ معدودة".
لكي نكون منصفين بشأن الحدود في الاتجاه الآخر: تلك الصفحة لا تصف تحديد هوية المتحدث، أو الطوابع الزمنية على مستوى الكلمة، أو البث المباشر في الوقت الفعلي. هذه هي بالضبط الميزات التي أطلقتها Google. إذا كنت بحاجة إلى مخرجات مقسمة حسب المتحدثين ومصحوبة بطوابع زمنية لمكالمة تضم ثلاثة أشخاص، فإن النموذج الجديد هو الأداة الأفضل لهذه الخطوة.
النقطة التي يتوقف عندها التداخل بين الاثنين هي المنتج النهائي. تغطي صفحة منشئ التقارير بالذكاء الاصطناعي تحويل ملفات المصدر إلى تقرير مكتوب، كما تتوفر مخرجات مستندات Office في خطة Pro.
بدائل تستحق المعرفة
إذا كان هدفك هو الحصول على سجلات الاجتماعات بدلاً من واجهات الصوت، فهناك ثلاثة مسارات أخرى.
الملخص الخاص بمنصة الاجتماعات الخاصة بك. يجمع Microsoft Teams التسجيل، والملفات المشتركة، والملاحظات، وجدول الأعمال، ومهام المتابعة في مكان واحد بعد أي حدث مسجل. تتطلب ميزات الملخص الذكي اشتراك Teams Premium أو ترخيص Copilot.
أداة تدوين ملاحظات مخصصة. تنضم هذه الأدوات إلى المكالمة، وتنتج ملخصًا، وتحتفظ بالسجل داخل منتجها الخاص. وهي مفيدة عندما يكون الاجتماع نفسه هو المنتج المطلوب.
المخرجات النصية بالإضافة إلى ملف المصدر الخاص بك. يستغرق إعداد هذا المسار وقتًا أطول، ولكنه المسار الوحيد الذي تأتي فيه الأرقام الواردة في التقرير المكتوب من الملف المصدر المصدر بدلاً من قراءتها بصوت عالٍ من قِبل شخص ما.
يعتمد الخيار المناسب على سؤال واحد: هل الجزء القيم من الاجتماع هو ما قاله الحاضرون، أم ما أظهرته البيانات؟ تخدم المسارات الثلاثة الأولى الخيار الأول جيدًا. بينما يخدم المسار الأخير الخيار الثاني فقط.
من التفريغ النصي إلى المنتج النهائي
يمثل Gemini 3.5 Transcribe خطوة حقيقية في حل مشكلة محددة. فالنص الأكثر نظافة، وتحديد هوية ثلاثة متحدثين، والطوابع الزمنية على مستوى الكلمة، وأكثر من 85 لغة، كلها عوامل تقلل من التعديلات التي كانت تتبع كل تسجيل.
ما لا يفعله هو تحديد ما نتج عن الاجتماع. فهذا لا يزال يأتي من البيانات الكامنة وراء النقاش، ولهذا السبب يجب أن يكون التفريغ النصي وملف المصدر في نفس المكان.
تغطي مقارنتنا مع Gemini Deep Research الجانب البحثي من نفس السؤال. لتحويل التسجيل وملفه المصدر إلى ملخص جاهز، جرب Powerdrill Bloom.
الحقائق الواردة هنا هي اعتبارًا من 31 أغسطس 2026، مأخوذة من صفحة إعلان Google.
الأسئلة الشائعة
ما هو Gemini 3.5 Transcribe؟
هو نموذج تحويل الكلام إلى نص من Google والذي تم الإعلان عنه في 26 أغسطس 2026. تصفه Google بأنه نموذجها الأكثر دقة لتحويل الكلام إلى نص حتى الآن، حيث يحول الصوت الخام إلى نص مصقول ومنسق.
ما مدى دقة Gemini 3.5 Transcribe؟
تنشر Google متوسط معدل خطأ في الكلمات يبلغ 4.0% للبث المباشر و 2.6% لحالات الاستخدام غير المباشر، وفقًا لقياسات Artificial Analysis. وعلى مقياس FLEURS تبلغ الأرقام 5.50% و 5.04%.
كم عدد المتحدثين الذين يمكنه تحديدهم؟
ما يصل إلى ثلاثة متحدثين في الصوت المسجل مسبقًا، مع طوابع زمنية. وتصف Google الدعم لأكثر من ثلاثة متحدثين بأنه تجريبي.
كيف يمكنني الوصول إلى Gemini 3.5 Transcribe؟
من خلال Gemini API في Google AI Studio و Gemini Enterprise Agent Platform. كما أنه يشغل الميزات الصوتية في Gboard على Android، وتطبيق Gemini على macOS، و Google Antigravity، مع الإشارة إلى أن Chrome سيتوفر قريبًا.
هل يكتب لي ملخص الاجتماع؟
يصف الإعلان عملية التفريغ الصوتي والتفويض لنماذج Gemini الأخرى بدلاً من إنتاج مستندات جاهزة. إن إنتاج سجل مكتوب يحتوي على الأرقام الأساسية هو خطوة منفصلة، ويتطلب ملف المصدر بالإضافة إلى الصوت.