اے آئی اور خود کاری

OpenAI کا Jalapeño: 1.9 گنا فی واٹ کارکردگی، مگر آزمائش کی ایک حد ہے

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ| 5
OpenAI کا Jalapeño: 1.9 گنا فی واٹ کارکردگی، مگر آزمائش کی ایک حد ہے

OpenAI نے 25 اگست 2026 کو Hot Chips کانفرنس میں اپنے پہلے custom inference chip، Jalapeño، کے ابتدائی تفصیلی benchmark نتائج پیش کیے۔ OpenAI کے شائع کردہ نتائج کے مطابق مخصوص InferenceX آزمائشوں میں Jalapeño system نے Nvidia Blackwell پر مبنی تقابلی systems کے مقابل peak throughput پر فی واٹ 1.5 سے 1.9 گنا زیادہ AI work اور 1.7 سے 3.6 گنا کم end-to-end latency دکھائی۔

اسی 25 اگست کی SemiAnalysis کی تکنیکی جانچ میں اس کے نمائندوں نے OpenAI انجینئروں کے ساتھ لیب میں InferenceX runs کا مشاہدہ کیا اور DeepSeek R1 پر کم concurrency میں فی صارف 700 سے زیادہ tokens فی second دیکھے۔ تاہم تمام اعداد OpenAI نے فراہم کیے، مکمل benchmark suite SemiAnalysis نے خود نہیں چلائی، اور یہ کسی آزاد production fleet کی آزمائش نہیں تھی؛ یہی headline میں درج 1.9 گنا نتیجے کی بنیادی حد ہے۔

1.9 گنا نتیجہ کس آزمائش سے نکلا

GPT‑OSS 120B آزمائش میں Jalapeño اور GB200 کی فی کلوواٹ throughput اور latency کا تقابل

سب سے بڑا peak performance-per-watt فرق GPT‑OSS 120B کے nominal 8k input اور 1k output token workload میں درج ہوا۔ Single-token prediction کے اس test میں Jalapeño نے 85,448 mixed tokens فی second فی kilowatt دیے، جبکہ Nvidia GB200 system کا نتیجہ 44,960 تھا—تقریباً 1.9 گنا فرق۔ اسی configuration میں end-to-end latency 1.03 seconds بمقابلہ 1.80 seconds اور کم ترین time-between-tokens 0.69 milliseconds بمقابلہ 1.87 milliseconds رہا۔

یہ اعداد صرف chip کی نظریاتی رفتار نہیں ناپتے۔ InferenceX درخواست کو serve کرنے والے system کی throughput، فی صارف token rate اور latency کو مختلف concurrency levels پر دیکھتا ہے، جبکہ توانائی کی نسبت published package power rating سے normalize کی گئی۔ Jalapeño کے لیے یہ rating 700 watts اور GB200 کے لیے 1,200 watts تھی؛ OpenAI کے مطابق آزمودہ workloads میں Jalapeño کی مسلسل ناپی گئی کھپت 550 watts یا اس سے کم رہی، مگر تقابل میں دونوں accelerators کی شائع شدہ ratings استعمال ہوئیں۔

اسی لیے 1.9 گنا کو ہر درخواست میں 1.9 گنا تیز جواب سمجھنا درست نہیں۔ یہ ایک متعین model، input-output profile، decoding method اور peak operating point پر پورے آزمودہ system کا throughput-per-power تناسب ہے۔ اس test point پر latency بھی بہتر تھی، لیکن throughput اور انفرادی صارف کی رفتار الگ پیمانے ہیں اور دوسرے traffic patterns میں ان کا تعلق بدل سکتا ہے۔

دوسرے models پر برتری یکساں نہیں رہی

OpenAI لیب میں DeepSeek R1 پر Jalapeño کا کم concurrency InferenceX run اور 700 سے زیادہ tokens فی second

DeepSeek R1 670B کے nominal 8k/1k، single-token prediction test میں تقابل GB300 سے ہوا۔ Jalapeño نے peak پر 19,641 mixed tokens فی second فی kilowatt کے مقابل 11,781 حاصل کیے، یعنی تقریباً 1.7 گنا فرق؛ end-to-end latency 1.65 seconds بمقابلہ 5.99 seconds تھی۔ کم ترین time-between-tokens پر فی صارف رفتار 700 tokens فی second کے مقابل 169 رہی۔

Kimi K2.5 1T میں بھی مقابل GB300 سے تھا، مگر peak efficiency کا فرق تقریباً 1.5 گنا رہ گیا: 18,195 بمقابلہ 11,862 mixed tokens فی second فی kilowatt۔ End-to-end latency 1.56 seconds بمقابلہ 5.31 seconds تھی۔ ان نتائج سے واضح ہے کہ “Blackwell سے 1.9 گنا بہتر” پورے benchmark کا عمومی خلاصہ نہیں؛ 1.9 گنا صرف GPT‑OSS test کا سب سے بڑا peak efficiency نتیجہ ہے۔

بعض operating points پر throughput کے فرق 50 گنا سے بھی زیادہ دکھائی دیتے ہیں، لیکن وہ peak-to-peak موازنہ نہیں۔ وہاں Jalapeño کی throughput اس interactivity level پر ناپی گئی جسے Blackwell system پہلے حاصل کر رہا تھا۔ ایسے matched-interactivity نتائج یہ بتاتے ہیں کہ ایک ہی فی صارف رفتار برقرار رکھتے ہوئے system کتنا مجموعی کام کر سکتا ہے؛ انہیں ہر حالت میں عمومی رفتار کا multiplier سمجھنا گمراہ کن ہوگا۔

مشاہدہ شدہ benchmark اور آزاد validation میں فرق

SemiAnalysis کی موجودگی vendor کی غیر مشاہدہ شدہ presentation سے زیادہ مضبوط ثبوت فراہم کرتی ہے: اس نے hardware کو لیب میں دیکھا اور InferenceX workload چلتے ہوئے verify کیا۔ لیکن ادارے نے صاف لکھا کہ اعداد OpenAI نے فراہم کیے، اس نے پورا InferenceX suite خود نہیں چلایا اور AgentX کے نتائج بھی دستیاب نہیں تھے۔ لہٰذا اسے بالمشافہ مشاہدہ شدہ benchmark کہنا درست ہے، مکمل آزاد test نہیں۔

طریقۂ آزمائش کی دوسری حد nominal 8k/1k، single-turn workload ہے۔ طویل context اور multi-turn production traffic routers، prefix cache، cache management اور offload infrastructure پر ایسا دباؤ ڈال سکتا ہے جو اس مختصر test میں سامنے نہیں آتا۔ نئی model families کے لیے kernels اور model-specific optimization بھی درکار ہوتے ہیں، اس لیے تین models پر کامیابی خودبخود ہر موجودہ یا آئندہ model پر وہی تناسب ثابت نہیں کرتی۔

Nvidia سے تقابل میں وقت بھی اہم ہے۔ GPT‑OSS کے لیے GB200 اور باقی دو models کے لیے GB300 استعمال ہوا؛ ایک ہی Blackwell configuration نے تمام tests نہیں دیے۔ SemiAnalysis کے مطابق Jalapeño کی وسیع دستیابی تک زیادہ موزوں حریف Nvidia کی Rubin نسل ہو سکتی ہے، اس لیے موجودہ نتائج 2026 کی آزمودہ configurations کے مقابل پوزیشن دکھاتے ہیں، 2027 کی production market کی حتمی درجہ بندی نہیں۔

Deployment محدود رہے گا، اس لیے لاگت کا اثر ابھی مشروط ہے

محدود Jalapeño systems کی production qualification، وسیع deployment سے پہلے

فی واٹ زیادہ tokens کا عملی فائدہ یہ ہے کہ محدود datacenter power envelope میں زیادہ inference requests مکمل کی جا سکتی ہیں۔ اگر یہی کارکردگی production scale پر برقرار رہی تو OpenAI serving capacity بڑھا سکتی ہے اور فی token توانائی و latency پر بہتر کنٹرول حاصل کر سکتی ہے۔ تاہم benchmark صارفین کے لیے قیمت میں کمی ثابت نہیں کرتا؛ اصل لاگت میں chip yield، memory، networking، cooling، utilization، software maturity اور fleet reliability بھی شامل ہیں۔

Jalapeño ابھی وسیع production deployment میں نہیں ہے۔ TechCrunch کی deployment رپورٹ میں OpenAI کے hardware سربراہ Richard Ho نے 2026 کے آخر میں بہت کم مقدار سے تعیناتی اور 2027 میں زیادہ نمایاں deployment کا اندازہ دیا۔ OpenAI کے مطابق production qualification، software کی پختگی، مزید models پر validation اور بڑے پیمانے پر operation کی تیاری ابھی جاری ہے۔

اب تک ثابت شدہ نتیجہ محدود مگر اہم ہے: OpenAI کی لیب میں مشاہدہ شدہ InferenceX runs کے دوران Jalapeño system نے تین بڑے open models پر آزمودہ Blackwell configurations کے مقابل بہتر peak performance per watt اور کم latency دکھائی۔ جو بات ابھی ثابت نہیں ہوئی وہ یہ ہے کہ یہی فائدہ آزادانہ طور پر چلائے گئے مکمل suites، طویل multi-turn traffic، بڑے production fleet اور اس وقت دستیاب نئے accelerators کے مقابل بھی برقرار رہے گا۔ اگلا فیصلہ کن ثبوت ابتدائی deployment کے operational اعداد اور تیسرے فریق کے زیر انتظام وسیع production benchmarks ہوں گے۔

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0