Qwen3.8-LiveTranslate میں تاخیر 2.3 سیکنڈ، مگر Urdu output ابھی سوال ہے

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ| 3
Qwen3.8-LiveTranslate میں تاخیر 2.3 سیکنڈ، مگر Urdu output ابھی سوال ہے

Qwen نے 18 ستمبر 2026 کو Qwen3.8-LiveTranslate کا اعلان کیا، جو گفتگو کے دوران متن اور آواز میں ترجمہ پیدا کرنے والا simultaneous interpretation model ہے۔ Qwen کے تحقیقی اعلان میں average lagging کو پچھلی نسل کے 2.8 سیکنڈ سے کم ہو کر 2.3 سیکنڈ بتایا گیا ہے، مگر یہ کمپنی کی اپنی مجموعی پیمائش ہے۔

اردو کے بارے میں دستیابی اور کارکردگی الگ سوال ہیں: سرکاری دستاویزات اردو کو audio اور text output والی زبانوں میں رکھتی ہیں، لیکن پاکستانی لہجوں، اردو-انگریزی code-switching یا شور والی گفتگو کے لیے الگ نتیجہ شائع نہیں کیا گیا۔ ریلیز کے اگلے دن آنے والی IT之家 کی رپورٹ نے بھی 60 زبانوں اور 2.3 سیکنڈ کے عدد کو Qwen سے منسوب کیا، مگر کوئی آزاد Urdu-specific test پیش نہیں کیا۔

اردو input، transcript اور آواز میں کہاں شامل ہے

زبان کی support کو صرف ایک فہرست سے سمجھنا کافی نہیں۔ پہلے مرحلے میں ماڈل source audio کی زبان پہچانتا ہے؛ دوسرے میں source transcript اور ترجمہ شدہ متن پیدا کرتا ہے؛ تیسرے میں منتخب target language میں ترجمہ شدہ آواز دیتا ہے۔ پاکستانی استعمال کے لیے اصل فرق اسی آخری مرحلے کا ہے، کیونکہ captions کی دستیابی لازماً قابلِ فہم اور فطری آواز کی ضمانت نہیں بنتی۔

QwenCloud کی LiveTranslate دستاویزات اردو کو ان 29 زبانوں میں شمار کرتی ہیں جن کے لیے audio اور text دونوں output دستیاب ہیں؛ مجموعی طور پر ماڈل 60 source languages لیتا ہے، جبکہ باقی 31 target languages صرف text output دیتی ہیں۔ اسی صفحے پر audio اور image input، text یا speech output، 2.3 سیکنڈ تک latency، speaker diarization اور hotwords کی سہولت بھی درج ہے۔

اس کا درست مطلب یہ ہے کہ اردو voice output دستاویزی طور پر دستیاب ہے؛ یہ کہنا درست نہیں کہ اردو صرف input یا transcript تک محدود ہے۔ البتہ دستاویزات کوئی الگ Urdu accuracy score، voice-quality rating یا پاکستانی لہجوں کی latency breakdown نہیں دیتیں۔ عنوان میں موجود سوال اسی عملی معیار کے بارے میں ہے، اردو output کی فہرست میں موجودگی کے بارے میں نہیں۔

2.3 سیکنڈ ہر کال کی ضمانت نہیں

Qwen کا 2.3 سیکنڈ کا عدد average lagging، یا LAAL، سے متعلق ہے۔ کمپنی کے مطابق پچھلے model میں یہی پیمائش 2.8 سیکنڈ تھی، اس لیے دعویٰ نصف سیکنڈ کی بہتری کا ہے۔ یہ تقابل model generation کی رفتار سمجھنے میں مفید ہے، مگر اسے پاکستان میں ہر meeting یا broadcast کے لیے end-to-end service guarantee نہیں سمجھا جا سکتا۔

صارف تک پہنچنے والا مجموعی وقفہ صرف model inference سے نہیں بنتا۔ microphone capture، audio buffering، پاکستان سے cloud endpoint تک network latency، تصویری frames کی ترسیل اور output audio playback بھی انتظار بڑھا سکتے ہیں۔ تیز بولنے والے مقرر، بار بار بدلتی باری اور کمزور رابطہ بھی حقیقی تجربے کو vendor benchmark سے مختلف بنا سکتے ہیں۔

یہ فرق خاص طور پر اس لیے اہم ہے کہ Qwen کا اعلان مجموعی multilingual performance بیان کرتا ہے، اردو کی الگ پیمائش نہیں۔ لہٰذا 2.3 سیکنڈ کو vendor-reported benchmark کہنا زیادہ درست ہے؛ اسے اردو یا کسی پاکستانی نیٹ ورک پر ثابت شدہ اوسط قرار دینے کے لیے الگ test data درکار ہوگا۔

Video کا مطلب audio کے ساتھ تصویری frames ہے

QwenCloud ماڈل کو real-time audio/video translation کے طور پر بیان کرتا ہے، لیکن API کی input modalities audio اور image ہیں۔ دستاویزی workflow میں video stream یا مقامی video سے audio کے ساتھ تصویری frames بھیجے جاتے ہیں، تاکہ ہونٹوں کی حرکت، اشارے یا منظر میں موجود معلومات مبہم الفاظ کا سیاق واضح کر سکیں۔ یہ عام one-shot endpoint پر پوری video file دے کر تیار ترجمہ لینے والا طریقہ نہیں ہے۔

Output کو text-only یا text-plus-audio پر رکھا جا سکتا ہے۔ Qwen3.8 variant میں ASR transcription مسلسل فعال رہتی ہے، اس لیے platform source transcript کو ترجمہ شدہ متن اور آواز سے الگ وصول کر سکتا ہے۔ مختلف مقررین کی باری پہچاننے کے لیے speaker diarization بھی default طور پر موجود ہے، مگر کسی حساس یا رسمی transcript میں غلط speaker attribution کا امکان ختم ہونے کا دعویٰ دستاویزات نہیں کرتیں۔

API دستیاب ہے، integration WebSocket سے ہوگی

Cloud model کا مکمل ID qwen3.8-livetranslate-flash-realtime ہے اور اسے WebSocket Realtime API کے ذریعے چلایا جاتا ہے۔ Developer session میں target language اور output modalities مقرر کرتا ہے، پھر audio مسلسل stream کی جاتی ہے؛ ضرورت ہو تو image frames بھی شامل کیے جا سکتے ہیں۔ یہ روایتی HTTP request میں ایک audio file بھیج کر ایک مکمل جواب لینے والا model نہیں ہے۔

Meetings، live streams اور broadcast systems کے لیے WebSocket مسلسل دو طرفہ ترسیل ممکن بناتا ہے، مگر integration میں connection lifecycle بھی سنبھالنا پڑتا ہے۔ دستاویزات کے مطابق session ختم کرتے وقت finish event بھیجنا ضروری ہے؛ صرف socket بند کرنے سے آخری speech segment ضائع ہو سکتا ہے یا connection معلق رہ سکتا ہے۔

پاکستانی meetings کے لیے fallback کی حد

اردو output کی آزاد جانچ آنے تک محتاط deployment میں اصل audio، source transcript اور translated Urdu text کو الگ محفوظ رکھنا مناسب ہوگا۔ ترجمہ شدہ آواز کو presentation layer رکھا جا سکتا ہے، تاکہ تلفظ، نام یا speaker attribution خراب ہونے پر captions اور اصل recording دستیاب رہیں۔ یہ ایک اداریاتی workflow recommendation ہے، شائع شدہ benchmark کا حصہ نہیں۔

ناموں، شہروں، سرکاری عہدوں اور شعبہ جاتی اصطلاحات کے لیے hotwords مدد دے سکتے ہیں، مگر وہ Urdu-specific evaluation کا متبادل نہیں۔ اسی طرح 60 زبانوں کی مجموعی support سے یہ ثابت نہیں ہوتا کہ ایک ہی جملے میں بار بار اردو اور انگریزی بدلنے پر معیار یکساں رہے گا۔ ایسے استعمال میں transcript اور translated text کو آواز سے الگ دیکھنے کی صلاحیت زیادہ اہم ہو جاتی ہے۔

ابھی ثابت کیا ہے، اور جواب کس چیز کا باقی ہے

دستیاب مواد سے Qwen3.8-LiveTranslate کا اعلان، cloud model کی دستیابی، WebSocket API، audio-plus-image input، text-plus-audio output، 60 source languages اور 29 voice-output languages کی تصدیق ہوتی ہے۔ اردو کو audio اور text output والی زبان کے طور پر واضح طور پر درج کیا گیا ہے۔

غیر واضح حصہ اردو آواز کی عملی کارکردگی ہے: پاکستانی لہجوں، code-switching، متعدد مقررین، کمزور نیٹ ورک اور مقامی ناموں کے لیے آزاد latency، transcription accuracy یا voice-quality results سامنے نہیں آئے۔ اس لیے 2.3 سیکنڈ ایک قابلِ ذکر vendor measurement ہے، جبکہ پاکستانی استعمال کے لیے اصل فیصلہ Urdu-specific test data پر منحصر رہے گا۔

یہ بھی پڑھیں:

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0