تخلیق کاروں کے ٹولز اور معیشت

DreamX-Creator کا 7B ماڈل تصویر اور آواز ساتھ بناتا ہے—2K دعوے کی حد

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ| 3
DreamX-Creator کا 7B ماڈل تصویر اور آواز ساتھ بناتا ہے—2K دعوے کی حد

DreamX Team نے 31 اگست 2026 کو DreamX-Creator 1.0 کی تکنیکی رپورٹ شائع کی اور 3 ستمبر کو اس کے model weights اور inference code جاری کیے۔ اصل تکنیکی رپورٹ کے مطابق نظام کا مرکز 7B generator ہے جو ایک ابتدائی فریم اور متنی prompt سے ویڈیو اور اس سے متعلق تقریر، صوتی اثرات اور ماحول کی آواز کو ایک ہی generative عمل میں بناتا ہے۔

یہ release مقامی طور پر چلائے جا سکنے والے مشترک آڈیو ویڈیو research framework کی ہے، کسی hosted production service کی نہیں۔ اس کا 2K دعویٰ بھی ایک اہم حد کے ساتھ درست ہے: 7B generator پہلے کم resolution کا آڈیو ویڈیو نتیجہ بناتا ہے، پھر الگ 5B refiner صرف ویڈیو کو 2K تک بہتر کرتا ہے؛ آزاد، مساوی شرائط والی وسیع جانچ ابھی دستیاب نہیں۔

7B generator آڈیو اور ویڈیو کو کہاں جوڑتا ہے

DreamX-Creator 1.0 میں الگ آڈیو اور ویڈیو streams سے ہم وقت تقریر اور منہ کی حرکت بنتی ہے

DreamX-Creator میں آڈیو اور ویڈیو الگ latent streams میں رہتے ہوئے ایک ساتھ denoise ہوتے ہیں۔ Network کا پہلا نصف دونوں streams کو الگ سنبھالتا ہے، جبکہ بعد کے blocks میں Gated Cross-Modal Attention کے دو راستے ویڈیو کو آڈیو سے اور آڈیو کو ویڈیو سے معلومات لینے دیتے ہیں۔

ہر فعال attention head کے output پر token اور head کی سطح کا gate لگتا ہے۔ مصنفین کا دعویٰ ہے کہ یہ محدود تبادلہ ہر modality کی اپنی نمائندگی محفوظ رکھتے ہوئے بولتے چہرے اور تقریر، دکھائی دینے والے impact اور اس کی آواز، نیز حرکت اور ambience کے وقت کو جوڑنے میں مدد دیتا ہے۔ یہ architecture synchronization کو ممکن بنانے کی تکنیکی بنیاد ہے، مگر ہر منظر میں درست ہم وقتی کی ضمانت نہیں۔

A2V، V2A اور Joint نام اس architecture کی training configurations ہیں؛ انہیں تین الگ user-facing tools سمجھنا درست نہیں۔ جاری inference workflow کا واضح input ایک ابتدائی تصویر اور مشترک متنی prompt ہے، اس لیے صرف اس release کی بنیاد پر مکمل text-to-video یا ہر ممکن input mode کی دستیابی اخذ نہیں کی جا سکتی۔

2K نتیجہ 7B generator کا براہِ راست output نہیں

DreamX-Creator کی ویڈیو الگ 2K refinement سے زیادہ تفصیل پاتی ہے جبکہ آواز کا وقت برقرار رہتا ہے

Base generator پہلے coherent مگر کم resolution والی ویڈیو اور اس کی آواز بناتا ہے۔ اس کے بعد Autoregressive 1-Step 2K Refiner ویڈیو کو temporal chunks میں process کرتا ہے؛ یہاں “1-step” سے مراد ہر chunk کے لیے ایک denoising evaluation ہے، نہ کہ پورے clip کی ایک ہی operation میں فوری تیاری۔

Refiner کم resolution ویڈیو اور پہلے سے بہتر کیے گئے chunks کو condition کے طور پر استعمال کرتا ہے۔ اس مرحلے میں audio stream تبدیل نہیں ہوتی، جبکہ دعویٰ یہ ہے کہ spatial detail بڑھاتے وقت مواد، motion اور پہلے سے قائم audio-aligned timing محفوظ رہتی ہے۔ یوں “7B model براہِ راست 2K آڈیو ویڈیو بناتا ہے” نامکمل خلاصہ ہے: مکمل راستے میں 7B joint generator کے بعد الگ SR-DiT 5B refiner شامل ہے۔

یہ فرق deployment cost سمجھنے کے لیے بھی ضروری ہے۔ 7B صرف مرکزی generator کا parameter count ہے؛ refiner، video اور audio VAE، text encoder، checkpoint storage اور memory offloading مجموعی ضرورت کا حصہ ہیں۔ شائع شدہ مواد کسی عام پاکستانی workstation کے لیے کم از کم VRAM، مکمل storage footprint، فی clip بجلی کی لاگت یا قابلِ اعتماد end-to-end رفتار کی ایک جامع حد نہیں دیتا۔

Weights ملتے ہیں، مگر production readiness ثابت نہیں

سرکاری DreamX-Creator repository میں 3 ستمبر 2026 کو 7B generator اور 2K Refiner کے weights اور inference code کے اجرا کے ساتھ Apache 2.0 project license درج ہے۔ Checkpoints GitHub repository کے اندر شامل نہیں؛ انہیں Hugging Face یا ModelScope سے الگ download کرکے مقررہ directory structure میں رکھنا ہوتا ہے۔

Repository generator کے لیے single-GPU script، CPU offload اور multi-GPU sequence-parallel راستے دیتی ہے، مگر کسی مخصوص GPU یا کم از کم VRAM کو عمومی hardware requirement کے طور پر مقرر نہیں کرتی۔ “Single GPU” کا مطلب اس لیے یہ نہیں کہ پورا نظام ہر consumer graphics card پر عملی رفتار سے چلے گا۔

جاری default generator settings 24 frames per second، پانچ سیکنڈ duration اور 50 denoising steps رکھتی ہیں۔ Duration کو بدلا جا سکتا ہے، لیکن repository طویل clips کے لیے معیار، memory growth یا رفتار کی تصدیق شدہ performance profile نہیں دیتی۔ کم sampling steps والے distilled اور تیز models ابھی roadmap میں ہیں، موجودہ release کا حصہ نہیں۔

Benchmark میں واضح کامیابیاں بھی ہیں اور خلا بھی

DreamX-Creator 1.0 کے محدود benchmark میں ویڈیو معیار، lip sync اور آواز کا الگ تقابل

رپورٹ کی quantitative evaluation Verse-Bench پر video quality، audio aesthetics، speech accuracy، lip sync اور audio-video alignment کو الگ metrics سے ناپتی ہے۔ مصنفین نے ان comparisons کو خود “preliminary” کہا ہے؛ یہ ایک واحد مجموعی ranking نہیں، اور تمام نتائج project کی اپنی evaluation pipeline سے آئے ہیں۔

بڑے open-weight systems کے مقابلے میں DreamX-Creator کا RL والا 7B نتیجہ بعض video-quality اور temporal synchronization پیمانوں پر مضبوط تھا، مگر LTX-2.3 اور MiniMax-H3 کئی audio-aesthetic اور cross-modal semantic metrics میں آگے رہے۔ Refiner نے بعض spatial-quality metrics بہتر کیے، لیکن اسی جدول میں lip-sync اور desynchronization کے اعداد base result کے مقابلے میں ہر سمت بہتر نہیں ہوئے۔

مصنفین کی blind human-preference study نے Verse-Bench سے نمونے لیے، model identities چھپائیں اور چار پہلوؤں پر win، tie یا loss درج کیا۔ خود رپورٹ تسلیم کرتی ہے کہ انتہائی dynamic اور compositionally complex مناظر کم نمائندگی رکھتے تھے، جبکہ بڑے صنعتی systems کے مقابلے میں audio quality اور audio-video alignment پر losses زیادہ تھے۔ اس لیے نتائج محدود sample پر مسابقت دکھاتے ہیں، مجموعی برتری نہیں۔

7 ستمبر کے ایک ثانوی تکنیکی جائزے نے بھی واضح کیا کہ پیش کیے گئے performance اعداد developer کے self-reported نتائج ہیں اور اس وقت آزاد third-party verification کی تصدیق نہیں ہوئی تھی۔ یہ تحریر architecture اور release کا الگ خلاصہ فراہم کرتی ہے، مگر خود hands-on benchmark نہیں؛ اس بنا پر اسے paper کے دعووں کی آزاد تجرباتی توثیق نہیں سمجھنا چاہیے۔

ابھی ثابت شدہ حد کہاں تک ہے

موجودہ شواہد تین باتوں کی تائید کرتے ہیں: DreamX-Creator 1.0 ایک شائع شدہ native joint audio-video research system ہے؛ اس کا مرکزی generator 7B ہے؛ اور generator، inference code اور الگ 2K refinement artifacts download کے لیے دستیاب ہیں۔ عنوان میں “ساتھ بناتا ہے” اسی مشترک denoising architecture کا بیان ہے، جبکہ 2K کی حد الگ refinement stage پر لاگو ہوتی ہے۔

ابھی غیر ثابت پہلو production استعمال کے لیے زیادہ اہم ہیں: مختلف GPUs پر مکمل memory اور وقت، طویل clips کی عملی حد، اردو سمیت مختلف زبانوں میں speech quality، مشکل مناظر کے failure modes اور یکساں prompts و hardware پر آزاد تقابل۔ جب تک ایسی reproducibility reports سامنے نہیں آتیں، DreamX-Creator کو inspect اور reproduce کیے جا سکنے والے research release کے طور پر دیکھنا درست ہے، ثابت شدہ کم لاگت production system کے طور پر نہیں۔

یہ بھی پڑھیں:

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0