Modulate کو $25 ملین—آواز سمجھنے کے لیے 100 سے زیادہ ماڈل

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ
Modulate کو $25 ملین—آواز سمجھنے کے لیے 100 سے زیادہ ماڈل

Modulate کے 28 ستمبر 2026 کے اعلان کے مطابق، بوسٹن کی کمپنی نے Future Ventures کی قیادت میں $25 ملین کی نئی فنڈنگ حاصل کی؛ Hyperplane اور Lakestar بھی شریک ہوئے، مجموعی فنڈنگ $60 ملین ہوگئی اور اس کے Velma پلیٹ فارم کے پیچھے 100 سے زیادہ مخصوص ماڈل کام کرتے ہیں۔ کمپنی یہ سرمایہ اپنی صوتی تحقیق، مصنوعات، ڈویلپر سہولتوں اور شراکت داریوں کو بڑھانے پر لگانا چاہتی ہے۔ Velma کا کام گفتگو کے الفاظ کے ساتھ لہجے، ارادے، جذبات، مصنوعی آواز اور رویے کے اشاروں کا تجزیہ کرنا ہے۔

شریک بانی اور چیف ایگزیکٹو Carter Huffman نے TechCrunch سے گفتگو میں اپنی ترجیح “full nuance and full understanding of a conversation” کے الفاظ میں بیان کی۔ رپورٹ کے مطابق ماڈل پہلے آواز سے اشارے اخذ کرتے ہیں، پھر گفتگو کے سیاق میں ارادے یا ممکنہ خلاف ورزی کا تجزیہ کرتے ہیں۔ اسی بنا پر کمپنی Velma کو دھوکا دہی کی شناخت، صوتی ایجنٹوں کی نگرانی اور آن لائن گفتگو کے تحفظ کے لیے پیش کر رہی ہے۔

نئی سرمایہ کاری سے کیا بڑھے گا

فنڈنگ کا فوری مطلب تحقیق اور مصنوعات کی تیاری کے لیے مزید وسائل ہیں۔ Modulate مخصوص صوتی ماڈل بنانے، ڈویلپرز کے لیے سافٹ ویئر ٹولز اور رابطہ جاتی سہولتیں بڑھانے، اور دوسری کمپنیوں کے نظاموں کے ساتھ شراکت داریوں پر کام کرنا چاہتی ہے۔ یہ توسیع کا منصوبہ ہے؛ نئے ٹولز یا ہر نئے طریقۂ استعمال کی دستیابی کے لیے اعلان میں کوئی مشترک تاریخ نہیں دی گئی۔

اس کاروباری منصوبے میں Velma کو موجودہ صوتی خدمات کے ساتھ تجزیے کی ایک تہہ کے طور پر استعمال کیا جا سکتا ہے۔ رابطہ مرکز اپنی کال کا نظام چلاتا رہے، جبکہ صوتی تجزیہ اس بات کی نشان دہی کرے کہ بولنے والے کی آواز یا گفتگو میں کس نوعیت کا اشارہ سامنے آیا ہے۔ اس فرق سے واضح ہوتا ہے کہ نئی فنڈنگ کا ہدف کال چلانے کا پورا نظام بنانا نہیں، بلکہ ایسی صلاحیت کو وسعت دینا ہے جو مختلف صوتی نظاموں کے ساتھ کام کر سکے۔

Velma میں آواز سے فیصلے تک کا راستہ

Velma کی Ensemble Listening Model ساخت میں مخصوص ماڈل ضرورت کے مطابق منتخب ہوتے ہیں اور ان کے نتائج یکجا کیے جاتے ہیں۔ کچھ ماڈل زبان، لہجے، جذباتی کیفیت اور آواز کے مصنوعی ہونے جیسے اشارے دیکھتے ہیں۔ دوسرے ماڈل ان اشاروں کو گفتگو کے مقصد سے ملاتے ہیں: صارف کیا چاہتا ہے، کیا کوئی قاعدہ ٹوٹ رہا ہے، یا کال میں دھوکا دہی کا شبہ کیوں پیدا ہوا ہے۔

اس ترتیب میں نقلِ گفتار بولے گئے الفاظ فراہم کرتی ہے، مگر آواز کی ادائیگی سے ملنے والی معلومات اس سے الگ رہتی ہیں۔ مثال کے طور پر ایک صارف شائستہ الفاظ استعمال کرتے ہوئے بھی خودکار ایجنٹ کے جواب سے ناخوش ہو سکتا ہے۔ اسی طرح غیر معمولی صوتی ساخت مزید جانچ کا اشارہ ہو سکتی ہے، لیکن صرف اس بنیاد پر کسی کال کو دھوکا دہی قرار دینا درست نتیجہ نہیں ہوگا۔

مخصوص ماڈلوں کو ملانے کا فائدہ یہ ہے کہ نظام ایک ہی گفتگو کے بارے میں مختلف سوالات پوچھ سکتا ہے۔ مصنوعی آواز کی شناخت بولنے والے کی شناخت سے متعلق خطرہ سامنے لاتی ہے؛ ارادے کا تجزیہ یہ دیکھتا ہے کہ وہ کیا حاصل کرنا چاہتا ہے؛ اور ایجنٹ کی نگرانی جواب کے معیار یا قواعد کی پابندی کو پرکھتی ہے۔ یہ اشارے ایک دوسرے کی جگہ نہیں لیتے، اس لیے ان کے نتائج کو ایک ہی عمومی اسکور سمجھنا بھی گمراہ کن ہوگا۔

دھوکا دہی، ایجنٹ نگرانی اور تحفظ

رابطہ مراکز میں Velma کا نمایاں استعمال ایسی کال کو نشان زد کرنا ہے جس میں مصنوعی آواز یا مشکوک طرزِ گفتگو کا اشارہ ملے۔ مالیاتی خدمات کے لیے اس کی ممکنہ اہمیت کسی فون پر دی گئی ہدایت یا شناخت کے دعوے کی اضافی جانچ میں ہے۔ صوتی اشارہ تفتیش شروع کرنے میں مدد دے سکتا ہے؛ حتمی کارروائی کا طریقہ اس ادارے کے اپنے قواعد اور انسانی نگرانی پر منحصر ہوگا۔

صوتی ایجنٹوں کے معاملے میں نگرانی کا سوال مختلف ہے۔ یہاں تجزیہ یہ دکھا سکتا ہے کہ ایجنٹ صارف کی بات سمجھ رہا ہے یا اسے الجھا رہا ہے، اور اس کے جواب متعلقہ قواعد کے مطابق ہیں یا نہیں۔ اس سے گفتگو ختم ہونے کے بعد معیار جانچنے کے ساتھ دورانِ کال مسئلہ پہچاننے کی گنجائش بھی بنتی ہے۔ صارف کے نرم لہجے کو اطمینان کا قطعی ثبوت سمجھنا اس استعمال کی حد کو نظر انداز کرے گا۔

کمپنی کی ٹیکنالوجی سماجی اور گیمنگ پلیٹ فارموں پر ہراسانی یا دوسری نقصان دہ صوتی گفتگو کی نشان دہی کے لیے بھی استعمال ہوتی ہے۔ وہاں توجہ کسی مالی ہدایت کے بجائے گفتگو کے رویے اور پلیٹ فارم کے قواعد پر ہوتی ہے۔ ایک ہی بنیادی صوتی صلاحیت کے یہ الگ کام ہیں؛ کسی شعبے میں کارکردگی دوسرے شعبے کے نتائج کی ضمانت نہیں دیتی۔

کارکردگی کے اعداد کس کے ہیں

The Next Web کی رپورٹ میں درج کمپنی کے دعووں کے مطابق Velma حقیقی مثبت نتائج کی شناخت میں روایتی بڑے لسانی ماڈلوں سے دو گنا زیادہ درست ہے، سات گنا کم غلط الارم دیتا ہے اور ایک بڑے ماڈل والے طریقے کے مقابلے میں حسابی وسائل کے استعمال میں زیادہ سے زیادہ ایک ہزار گنا مؤثر ہو سکتا ہے۔ یہ تین الگ پیمانے ہیں، اور رپورٹ انہیں Modulate کے اپنے تقابل کے طور پر پیش کرتی ہے۔ انہیں کسی خاص رابطہ مرکز یا زبان میں ثابت شدہ نتیجہ سمجھنا درست نہیں ہوگا۔

غلط الارم کی شرح خاص طور پر اہم ہے: بہت زیادہ بےضرر کالیں نشان زد ہوں تو نگرانوں پر بوجھ بڑھتا ہے، جبکہ مشتبہ کال چھوٹ جائے تو دھوکا دہی کی شناخت کا مقصد متاثر ہوتا ہے۔ شائع شدہ معلومات اردو اور پاکستان میں بولے جانے والے دوسرے لہجوں کے الگ نتائج، حقیقی کال ماحول میں غلط الارم کی شرح، یا معاملہ انسانی نگران کو منتقل کرنے کی مقررہ حد واضح نہیں کرتیں۔ یہ تفصیل کارکردگی کے عمومی دعوے کو مقامی استعمال سے جوڑنے کے لیے درکار ہوگی۔

پاکستانی صوتی خدمات کے لیے اہمیت

پاکستانی رابطہ مراکز اور فن ٹیک اداروں کے لیے خبر کی اہمیت فنڈنگ کی رقم کے ساتھ اس ساخت میں ہے جو الفاظ، آواز کی ادائیگی اور گفتگو کے مقصد کو الگ الگ دیکھتی ہے۔ اگر کوئی ادارہ پہلے سے کال یا صوتی ایجنٹ چلاتا ہے تو ایسے اشارے مشتبہ کال اور غیر مؤثر خودکار جواب کے بارے میں مزید معلومات دے سکتے ہیں۔ یہ ایک ممکنہ استعمال ہے؛ دستیاب معلومات پاکستان میں Velma کی تنصیب یا یہاں اس کی کارکردگی کا ثبوت نہیں دیتیں۔

اب اس کہانی میں فیصلہ کن تفصیل مختلف زبانوں اور حقیقی کال ماحول کے نتائج ہوں گے۔ خاص طور پر اردو اور مقامی لہجوں میں مصنوعی آواز کی شناخت، چھوٹ جانے والی مشتبہ کالوں، غلط الارم اور انسانی نگرانی کے اعداد واضح کریں گے کہ یہ صوتی تجزیہ پاکستانی خدمات کے لیے کتنا قابلِ اعتماد ہے۔

یہ بھی پڑھیں:

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0