Muse Voice يفصل أكثر من 20 متحدثًا، لكن العربية غير موثقة ضمن اللغات المختبرة

أطلقت Meta في 1 سبتمبر 2026 نموذج Muse Voice Transcribe للنسخ الصوتي المتدفق، مع فصل أكثر من 20 متحدثًا واكتشاف بداية الكلام ونهايته في الزمن الحقيقي. ويؤكد إعلان Meta الرسمي أن النموذج متاح عبر Meta Model API وMeta AI لأجهزة Mac وMuse Code.
أما وضع العربية فيحتاج إلى تمييز دقيق: العربية مدرجة بالاسم ضمن اللغات الـ25 التي تنقل صفحات مستقلة عن وثائق Meta أنها خضعت للتحقق، لكن Meta لم تنشر في مواد الإطلاق المفتوحة نتيجة دقة أو زمن استجابة خاصة بالعربية. لذلك لا يثبت المتاح أن العربية غير مدعومة، ولا يبرر تعميم نتائج الاختبارات العامة على الفصحى واللهجات والتبديل اللغوي.
ما الذي يقدمه Muse Voice Transcribe؟
يجمع النموذج بين التعرف الآلي على الكلام أثناء تدفقه، وفصل المتحدثين، واكتشاف حدود الكلام. وتقول Meta إنه يستطيع التعامل مع صوت يتجاوز ساعة واحدة ومع أكثر من 20 متحدثًا من دون اشتراط مرحلة معالجة لاحقة، وهي قدرات تستهدف المحادثات والاجتماعات الطويلة لا الإملاء الفردي وحده.
يعالج Muse Voice Transcribe الصوت في مقاطع طول كل منها 80 ملي ثانية. وعند كل مقطع يقرر النموذج ما إذا كان سيستمع إلى سياق إضافي أو يصدر رمزًا نصيًا؛ وتصف Meta ذلك بالتأخير التكيفي، لأن الكلمة الواضحة قد تُثبت سريعًا بينما تحتاج الكلمة الأصعب إلى جزء أطول من الصوت.
يدعم النموذج أيضًا الانتقال بين اللغات داخل الجملة أو بين الجمل، ويمكن توجيهه باللغة المتوقعة والكلمات المفتاحية والسياق. هذه خصائص قد تفيد المحادثات التي تمزج العربية بالإنجليزية أو الفرنسية، لكنها لا تمثل في ذاتها قياسًا منشورًا لجودة النسخ العربي.
العربية مدرجة، لكن نتيجة أدائها غير منشورة

قالت Meta إن بيانات التدريب شملت أكثر من 70 لغة وإن 25 لغة خضعت لتحقق موسع. وتعرض صفحة الإطلاق العامة أمثلة بالصينية والفرنسية والهندية واليابانية والإسبانية والفيتنامية، بينما تنقل مراجعة Kingy AI لوثائق المطورين قائمة اللغات الـ25 متضمنة العربية صراحةً.
هذا يصحح الاستنتاج القائل إن غياب العربية عن أمثلة صفحة الإطلاق يعني خروجها من مجموعة اللغات المتحقق منها. في المقابل، لا تعرض المواد المفتوحة جدولًا يبين نسبة خطأ الكلمات للعربية، أو الفروق بين الفصحى واللهجات، أو أداء علامات الترقيم وكتابة الأسماء، أو دقة فصل المتحدثين في محادثة عربية.
كذلك لا تعني عبارة «خضعت للتحقق» أن جميع اللغات حققت مستوى واحدًا. فالقائمة تثبت أن العربية ضمن نطاق التحقق المعلن، لكنها لا تكشف حجم عينتها أو مصادر الصوت أو اللهجات المشمولة أو معايير النجاح. ويظل الفرق مهمًا بين توثيق وجود اللغة وتوثيق نتيجة قابلة للمقارنة.
لماذا لا تكفي نتيجة AA-WER للحكم على العربية؟
تقارن لوحة Artificial Analysis خدمات النسخ المتدفق وفق نسبة خطأ الكلمات، وزمن وصول أول نص، وزمن استقرار النص النهائي، والسعر. وتوضح منهجية AA-WER للنسخ المتدفق أن المؤشر مبني على نحو ثماني ساعات من الصوت: 50% من AA-AgentTalk و25% من VoxPopuli و25% من Earnings22.
يُحسب زمن النص النهائي ابتداءً من نهاية الكلام التي يرصدها SileroVAD، لا من لحظة بدء المتحدث جملته. وإذا كانت الخدمة تدعم فرض نهاية المقطع، ترسل المنهجية طلب الإنهاء عند تلك النقطة ثم تنتظر النسخة النهائية التالية؛ ولذلك يقيس الرقم مرحلة محددة من الاستجابة، وليس الزمن الكامل الذي يختبره المستخدم منذ بدء الحديث.
ولا تقدم الصفحة المفتوحة تقسيمًا مستقلًا لنتيجة العربية أو لهجاتها. نتيجة النموذج الإجمالية مفيدة لمقارنة الخدمات تحت شروط موحدة، لكنها لا تثبت تلقائيًا مستوى الأداء في مقابلة مغاربية، أو اجتماع خليجي، أو تسجيل يمزج الفصحى بلهجة محلية ولغة أجنبية.
كيف يمكن اختبار الجدوى العربية؟

في غياب أرقام عربية منشورة، يمكن بناء اختبار محدود وقابل للتكرار قبل اعتماد الواجهة. هذا بروتوكول مقترح، وليس قياسًا نفذته Quasa Media أو نتيجة منسوبة إلى Meta:
- إعداد تسجيلات منفصلة للفصحى ولهجتين أو أكثر، مع مقاطع تتضمن انتقالًا طبيعيًا إلى الإنجليزية أو الفرنسية.
- تضمين تسجيل لمتحدث واحد، وحوار ثنائي، ومحادثة متعددة المتحدثين، مع نص مرجعي يحدد الكلمات وهوية كل متحدث.
- استخدام المقاطع نفسها في بيئات هادئة وأخرى تتضمن ضوضاء أو تداخلًا في الكلام، ثم تثبيت شروط المقارنة بين الخدمات.
- حساب نسبة خطأ الكلمات، وإضافة نسبة خطأ الحروف عندما تجعل اختلافات الإملاء أو فصل الكلمات المقياس الأول مضللًا.
- قياس زمن أول نص قابل للقراءة، وزمن استقرار النص بعد توقف الكلام، وأخطاء نسب الجمل إلى المتحدثين، وأخطاء اكتشاف نهاية الدور كلًّا على حدة.
ومن المفيد تشغيل العينة مرة بالإعدادات الافتراضية ومرة مع تحديد اللغة والكلمات المتخصصة والسياق. بهذه الطريقة يمكن فصل أداء النموذج الأساسي عن التحسن الناتج من التوجيه، خصوصًا في الأسماء العربية والمصطلحات الأجنبية المكتوبة بحروف عربية أو لاتينية.
ما الذي حُسم وما الذي بقي مفتوحًا؟
المؤكد أن Muse Voice Transcribe أُطلق كخدمة متاحة، لا كعرض بحثي مؤجل، وأنه يوفر النسخ المتدفق وفصل أكثر من 20 متحدثًا واكتشاف نهاية الكلام. كما أن العربية تظهر ضمن قائمة اللغات الـ25 المنقولة عن وثائق Meta، خلافًا لما قد يوحي به اقتصار صفحة الإعلان العامة على ستة أمثلة مرئية.
غير المحسوم هو مستوى الدقة والزمن وفصل المتحدثين للمحتوى العربي تحديدًا. وحتى تنشر Meta نتائج مفصلة بحسب اللغة واللهجة، أو يقدم مختبر مستقل عينة عربية معلنة ومنهجية قابلة للمراجعة، تبقى عبارة «العربية متحقق منها» وصفًا لنطاق اللغة، لا ضمانًا لأداء مماثل للنتيجة الإجمالية.
اقرأ أيضًا:
اشترك في نشرتنا الإخبارية
احصل على أحدث أخبار الويب 3 والذكاء الاصطناعي والعملات المشفرة مباشرة في بريدك.