Gemini 3.5 Transcribe يفهم 85 لغة، لكن التوقيتات تخفض الدقة

طرحت Google في 26 أغسطس 2026 نموذج Gemini 3.5 Transcribe لتحويل الكلام إلى نص، وأتاحته للمطورين والمؤسسات في معاينة عامة. ويوضح إعلان Google أن الخدمة موزعة بين نموذج للبث الصوتي المباشر عبر Live API وآخر لمعالجة التسجيلات المكتملة عبر Interactions API.
يكتشف النموذج أكثر من 85 لغة تلقائياً، ويتابع الانتقال بينها داخل الجلسة، مع دعم المفردات المخصصة والنسخ المنسق. لكن توقيت كل كلمة وتمييز المتحدثين يقتصران على الملفات المسجلة، وتقول Google إن تشغيل توقيت الكلمات يخفض دقة النسخ؛ وهي مقايضة مؤثرة لمن يحتاج نصاً قابلاً للمزامنة مع الصوت.
نسخ حرفي أو نص منقح

لا يقدم Gemini 3.5 Transcribe مخرجاً واحداً لكل الأغراض. الوضع الحرفي يحافظ على كلمات التردد والتكرار والبدايات المتروكة، بينما ينظف وضع النسخ الذكي هذه العناصر، ويحل التصحيحات التي يجريها المتحدث أثناء الكلام، ثم يضيف علامات الترقيم والتنسيق البنيوي.
هذا الفرق يحدد طبيعة السجل الناتج. النص المنقح أنسب لمحاضر الاجتماعات والمقالات والنصوص المعدة للنشر، لكنه ليس سجلاً مطابقاً لكل لفظ قيل؛ أما الوضع الحرفي فيناسب المراجعة التي تتطلب الاحتفاظ بالترددات والتصحيحات الأصلية. ولا يمكن جمع الوضع الذكي مع توقيت الكلمات أو تمييز المتحدثين في الطلب نفسه.
تسمح الواجهة أيضاً بإرسال مفردات مخصصة لترجيح أسماء المنتجات والأشخاص والاختصارات والمصطلحات المهنية. وتدعم ما يصل إلى 1000 عبارة، مع إشارة Google إلى أن أفضل النتائج تتحقق عادة بقوائم لا تتجاوز 100 عبارة، ما يجعلها أداة للترجيح وليست قاموساً مضمون النتائج.
الملفات والبث الحي يخدمان احتياجات مختلفة

الفارق التقني الأهم ليس السرعة وحدها، بل نوع البيانات التي تعيدها كل واجهة. يخرج البث نصاً تدريجياً منخفض الكمون، لكنه لا يوفر توقيتاً لكل كلمة ولا يفصل المتحدثين؛ في المقابل، تستطيع معالجة الملفات إسناد المقاطع إلى أصوات مختلفة وإرفاق وقت بداية ونهاية بالكلمات.
تجمع صفحة النموذج في Gemini API حدود الاختيار: تصل جلسة البث إلى 10 دقائق، بينما يقبل مسار الملفات تسجيلاً يصل إلى ساعة، وينخفض الحد إلى 30 دقيقة عند تشغيل توقيت الكلمات أو تمييز المتحدثين. كما يدعم مسار الملفات ما يصل إلى ثمانية متحدثين، لكن الإسناد عند وجود ثلاثة متحدثين أو أكثر مصنف بأنه تجريبي.
- البث الحي: يلائم التعليقات النصية الفورية والوكلاء الصوتيين، ويدعم اكتشاف اللغة وتبديلها والمفردات المخصصة، من دون توقيتات مفردة للكلمات أو فصل للأصوات.
- الملفات المسجلة: تلائم الاجتماعات والمقابلات وسجلات المكالمات، وتضيف توقيت الكلمات وتمييز المتحدثين ضمن حدود أقصر عند تفعيلهما.
- الحاجة إلى مخرجين: قد يتطلب الحدث المباشر استخدام نموذج البث أثناء الجلسة، ثم إرسال التسجيل لاحقاً إلى نموذج الملفات لإنتاج نسخة منسوبة إلى المتحدثين أو مرتبطة بتوقيتات دقيقة.
التوقيتات تضيف المحاذاة وتنتقص من الدقة

ينشئ توقيت الكلمات إزاحة لبداية كل كلمة ونهايتها، وهي بيانات مطلوبة للترجمة المصاحبة والبحث داخل التسجيل والانتقال إلى موضع محدد في الصوت. إلا أن وثائق Google تنص على أن تفعيل هذه الخاصية يخفض دقة النسخ، من دون نشر مقدار ثابت لهذا الانخفاض أو نتيجة منفصلة لكل لغة.
لذلك لا تعني العبارة أن كل تسجيل سيفقد النسبة نفسها من الدقة. المواد المنشورة لا تحدد أثر الضوضاء أو اللهجة أو سرعة الكلام أو تداخل الأصوات عند تشغيل التوقيتات، ولا تقدم اختباراً مستقلاً يقارن المخرج نفسه مع الخاصية ومن دونها. المؤكد فقط هو وجود المقايضة التقنية المعلنة.
تؤدي الخاصية كذلك إلى تقليص مدة الملف المقبولة من ساعة إلى 30 دقيقة، وهي النتيجة التشغيلية المباشرة الثانية. أما البث الحي فلا ينتج توقيتات على مستوى الكلمة أصلاً، ولذلك لا يمكن اعتباره بديلاً مطابقاً لمسار الملفات في أعمال الترجمة المصاحبة أو التحرير المرتبط بالخط الزمني.
دعم العربية موجود، لكن بيانات اللهجات محدودة
تدرج Google العربية المصرية بالرمز ar-EG ضمن اللغات المدعومة في Gemini API. يستطيع النموذج اكتشاف اللغة تلقائياً ومتابعة التبديل داخل الجملة أو بين الجمل، ويمكن تحديد رمز اللغة مسبقاً عندما يكون معروفاً لتحسين الدقة المحتملة.
هذه القائمة لا تثبت مستوى أداء متساوياً في جميع اللهجات العربية. لم تنشر Google نتيجة معيارية منفصلة للعربية المصرية، ولا مقارنة بين العربية الفصحى ولهجات المنطقة أو بين تسجيلات الاستوديو ومكالمات خدمة العملاء. لذلك يثبت الإعلان وجود الدعم اللغوي، لا دقة موحدة لكل سوق وبيئة صوتية.
بالنسبة إلى اجتماع عربي يتخلله كلام إنجليزي أو فرنسي، يجمع النموذج بين تبديل اللغات والمفردات المخصصة. لكن الاجتماع الطويل متعدد الأصوات يواجه حدوداً أخرى: 30 دقيقة عند تشغيل الخصائص التفصيلية، وحالة تجريبية لإسناد ثلاثة متحدثين أو أكثر، وغياب توقيت الكلمات من واجهة البث.
الإتاحة الحالية ما زالت معاينة عامة
النموذجان متاحان للمطورين في Gemini API عبر Google AI Studio، وللمؤسسات عبر Gemini Enterprise Agent Platform، لكنهما لم ينتقلا إلى إصدار مستقر. وتؤكد تغطية 9to5Google حالة المعاينة العامة، إلى جانب استخدام التقنية في Rambler داخل Gboard وتطبيق Gemini على macOS، فيما يظل دمجها في Chrome معلناً لمرحلة لاحقة.
المعروف حتى الآن هو فصل واضح بين البث والملفات، ودعم أكثر من 85 لغة، وإتاحة التوقيتات وتمييز المتحدثين للملفات مع قيود في الدقة والمدة. وما لم تنشره Google بعد هو مقدار خسارة الدقة بسبب التوقيتات، ونتائج مفصلة للعربية، وموعد انتقال واجهتي المطورين من المعاينة إلى إصدار مستقر.
اشترك في نشرتنا الإخبارية
احصل على أحدث أخبار الويب 3 والذكاء الاصطناعي والعملات المشفرة مباشرة في بريدك.