Modulate تجمع 25 مليون دولار: مئة نموذج صغير تحلل الصوت الخام

|الكاتب: فريق تحرير QUASA|5 دقيقة للقراءة| 1
Modulate تجمع 25 مليون دولار: مئة نموذج صغير تحلل الصوت الخام

أعلنت Modulate، ومقرها بوسطن، في بيانها الصادر في 28 سبتمبر 2026 جمع 25 مليون دولار بقيادة Future Ventures وبمشاركة Hyperplane وLakestar، ليرتفع إجمالي تمويلها المعلن إلى 60 مليون دولار؛ وتقول إن منصة Velma تنسق أكثر من مئة نموذج صوتي متخصص لتحليل الصوت مباشرة. وخصصت الشركة المال لتطوير النماذج والأبحاث والهندسة وواجهات البرمجة والشراكات، بما يوسع حضور أدواتها لدى مطوري تطبيقات المحادثة الصوتية.

ونقلت تغطية SiliconANGLE للجولة قول المؤسس المشارك والرئيس التنفيذي كارتر هوفمان «Voice is becoming a primary interface for AI»، كما أوردت تقديرات الشركة بأن نماذجها تحلل أكثر من 10 ملايين ساعة صوت شهريًا، وأن إجمالي ما عالجته تجاوز 600 مليون ساعة، وأن Velma قد تكون أكثر كفاءة بما يصل إلى ألف ضعف من نهج النموذج الكبير الواحد، بينما تبلغ الدقة المعلنة لكاشف التزييف 98.9% على بيانات اختبار عامة. تشرح هذه الأرقام حجم التشغيل والنتائج التي تعرضها Modulate، لكنها لا تجعل كفاءة كل مهمة أو دقة كل إنذار قابلة للاستنتاج من حجم الصوت وحده.

كيف تعمل النماذج المتخصصة داخل Velma؟

تعرض Modulate منصتها طبقة لتحليل المحادثة يمكن دمجها في منتجات أخرى، لا وكيلاً صوتيًا يتحدث نيابة عن المؤسسة. الفكرة أن الصوت نفسه يحمل معلومات تضيع عندما يتحول إلى كلمات مكتوبة: طريقة التشديد، والانفعال، وتغير النبرة، وعلامات الصوت المصطنع. لذلك تتلقى Velma الصوت الخام وتستخرج منه إشارات يمكن استخدامها منفردة أو جمعها لتمييز سلوك داخل المحادثة، مثل احتمال محاولة انتحال أو تعثر وكيل صوتي في التعامل مع عميل.

تحت المنصة بنية تسمى Ensemble Listening Model تختار نماذج أصغر متخصصة وفق المهمة ثم تجمع نتائجها. بعض النماذج يلتقط خصائص الإشارة الصوتية، وبعضها يفسر السلوك أو المقصد في سياق الحوار؛ والتمييز مهم لأن معرفة ما إذا كان الصوت مصطنعًا تختلف عن معرفة ما إذا كان صاحبه يحاول الاحتيال. تتجنب هذه البنية تشغيل نموذج شامل لكل سؤال، وهو تفسير معقول لوعد تقليل الحوسبة، لكن مقدار الوفر في عملية بعينها يتوقف على النماذج المستدعاة وطول التسجيل والعتاد وزمن الاستجابة المطلوب.

يمكن لـVelma العمل أثناء المكالمة، بحيث تصل إشارة إلى التطبيق قبل انتهاء الحديث. من الناحية العملية، تختلف قيمة هذه الإشارة بحسب قرار المؤسسة: التحذير من صوت مصطنع، أو تنبيه المشرف إلى غضب المتصل، أو رصد إخفاق الوكيل في فهم الطلب. لا يقرر تصنيف واحد هذه الحالات جميعًا؛ فقيمة المنصة التجارية تقوم على ربط مؤشرات مختلفة بسياق كل محادثة.

لماذا يهم ذلك لمراكز الاتصال والوكلاء الصوتيين؟

في مركز الاتصال، قد يحتفظ التفريغ النصي بطلب تغيير بيانات الحساب، لكنه لا يصف بالضرورة خصائص الصوت التي تثير الشك في انتحال المتصل. وتعني إضافة تحليل الصوت أن نظام المكالمة يستطيع تلقي علامة خطر منفصلة عن الكلمات، ثم ضمها إلى قواعد التحقق والإجراءات التي يضعها مشغل الخدمة. هذه علامة للمراجعة، وليست إثباتًا بأن المتصل محتال؛ فالصوت الاصطناعي وسلوك الاحتيال سؤالان مختلفان.

أما عند مراقبة وكيل صوتي، فتتركز الفائدة المحتملة في معرفة كيف سارت المحادثة، لا في استخراج نصها فقط. قد تبقى عبارات المتصل مهذبة بينما تكشف إجاباته المتكررة أو طريقته في الحديث أن المشكلة لم تُحل. وقد يشير تحليل نبرة الوكيل وطريقة استجابته إلى موضع تعثر يستحق تدخلًا بشريًا، لكن تفسير الرضا أو الإحباط يظل حساسًا للغة والسياق ولا يمكن اختزاله في درجة عاطفية واحدة.

بدأت Modulate بأدوات للإشراف على المحادثات الصوتية في الألعاب والمنصات الاجتماعية، ثم نقلت خبرتها إلى كشف التزييف والاحتيال ومتابعة أداء الوكلاء الصوتيين. اتساع الاستخدامات يفسر اهتمامها بواجهات تتيح لمطور آخر إضافة الإشارات إلى منتجه، بدل بناء منظومة مستقلة لكل حالة. كما يفسر لماذا يتجه تمويل الجولة إلى أدوات التطوير وخيارات التشغيل والتكاملات، وهي عناصر تحدد إمكانية إدخال التحليل في مسار المكالمة القائم.

ما حدود أرقام الكفاءة والدقة المعلنة؟

حجم المعالجة الشهري والتراكمي يقيسان اتساع نشاط الشركة المعلن عبر تطبيقات متعددة؛ ولا يحددان حجم المكالمات التي جرى فيها كشف احتيال صحيح. كذلك فإن مقارنة الكفاءة مع نموذج كبير تعتمد على السؤال المطروح: تفريغ الكلام، وكشف التزييف، وفهم مقصد المتصل مهام ذات مدخلات ومخرجات مختلفة. من دون شروط مقارنة منشورة لنفس المهمة ونفس العتاد، يبقى الرقم الأعلى وصفًا لأفضل نتيجة تعرضها الشركة، لا تقديرًا جاهزًا لتكلفة تشغيل مركز اتصال محدد.

تقيس نسبة الدقة المعلنة لكاشف التزييف أداءه على بيانات اختبار عامة، فيما تخص صدارة لوحات التقييم العامة منتجات ومجموعات بيانات مختلفة. ولا يجوز نقل ترتيب التفريغ إلى وظيفة رصد الاحتيال أو تحويل دقة كاشف التزييف إلى نسبة إنذارات صحيحة في مكالمات العملاء. بالنسبة إلى مشغل اتصالات، تؤثر الإيجابيات الكاذبة في عدد المكالمات السليمة التي ستُصعّد، كما يؤثر زمن وصول الإشارة في إمكان التدخل أثناء المكالمة.

ما الذي تعنيه الأسعار ودعم العربية؟

توضح قائمة Modulate الرسمية للأسعار واللغات أن التفريغ متعدد اللغات يكلف 0.03 دولار لكل ساعة ملفات أو 0.06 دولار لكل ساعة بث، وأن كشف التزييف المنفصل يكلف 0.25 دولار للساعة، بينما يكلف Velma Triage لتحليل المحادثة 0.75 دولار للساعة؛ وتظهر العربية ضمن لغات تفريغ الملفات السريع، لكنها لا تظهر في قائمة لغات البث السريع لذلك المسار. الفروق بين هذه الخدمات تعني أن سعر التفريغ وحده لا يمثل تكلفة فهم السلوك أو تقييم خطر التزييف ضمن تشغيل فعلي.

ولا تكفي إتاحة تفريغ الملفات بالعربية للحكم على أداء المنصة مع اللهجات أو الانتقال بين لغتين في المكالمة نفسها؛ كما أن قائمة لغات مسار البث السريع لا تصف بالضرورة كل قدرات Velma. ولم تنشر الشركة في إعلان الجولة معدلات الإيجابيات الكاذبة أو زمن الاستجابة المقاس لمكالمات عربية حية. لذلك سيكون أثر التوسع على مراكز الاتصال في المنطقة مرتبطًا بما ستتيحه واجهاتها وخيارات تشغيلها من بيانات أداء مفصلة بحسب المهمة واللغة، لا بعدد النماذج وحده.

اقرأ أيضًا:

مشاركة:

اشترك في نشرتنا الإخبارية

احصل على أحدث أخبار الويب 3 والذكاء الاصطناعي والعملات المشفرة مباشرة في بريدك.

0