OpenAI Jalapeño کے benchmarks تیز ہیں، مگر موازنہ مکمل نہیں

OpenAI نے 25 اگست 2026 کو اپنے پہلے custom inference chip، Jalapeño، کے ابتدائی measured benchmarks جاری کیے۔ OpenAI کے شائع کردہ نتائج میں تین open models پر مقابل systems کے مقابلے میں peak throughput فی واٹ 1.5 سے 1.9 گنا زیادہ اور end-to-end latency 1.7 سے 3.6 گنا کم رہی۔
نتائج رفتار اور بجلی کی کارکردگی میں واضح ابتدائی برتری دکھاتے ہیں، لیکن فیصلہ کن موازنہ نہیں بنتے۔ tests مخصوص models، single-token prediction اور شائع شدہ package power ratings پر مبنی تھے؛ Nvidia Vera Rubin شامل نہیں تھا اور نتائج عام cloud صارفین کے لیے دستیاب کسی commercial instance کی کارکردگی نہیں دکھاتے۔
تین models پر اصل benchmark نتائج

OpenAI نے SemiAnalysis کے public InferenceX benchmark پر GPT‑OSS 120B، DeepSeek R1 670B اور Kimi K2.5 1T آزمائے۔ ہر مرکزی test میں nominal 8k input اور 1k output tokens، single-token prediction اور mixed throughput فی kilowatt استعمال ہوا، اس لیے ہر نسبت کو اسی model اور مقابل configuration تک محدود سمجھنا ضروری ہے۔
- GPT‑OSS 120B بمقابلہ Nvidia GB200: package ratings 700W اور 1,200W تھیں۔ peak mixed throughput فی kilowatt 85,448 بمقابلہ 44,960، یعنی تقریباً 1.9 گنا زیادہ رہا؛ end-to-end latency 1.03 سیکنڈ بمقابلہ 1.80 سیکنڈ، تقریباً 1.7 گنا کم تھی۔
- DeepSeek R1 670B بمقابلہ Nvidia GB300: 700W اور 1,400W ratings کے ساتھ throughput فی kilowatt 19,641 بمقابلہ 11,781، تقریباً 1.7 گنا زیادہ رہا۔ latency 1.65 سیکنڈ بمقابلہ 5.99 سیکنڈ تھی، جو تقریباً 3.6 گنا کمی بنتی ہے۔
- Kimi K2.5 1T بمقابلہ Nvidia GB300: اسی 700W بمقابلہ 1,400W normalization میں throughput فی kilowatt 18,195 بمقابلہ 11,862، تقریباً 1.5 گنا زیادہ تھا۔ latency 1.56 سیکنڈ بمقابلہ 5.31 سیکنڈ، یعنی تقریباً 3.4 گنا کم رہی۔
یہ اعداد ایک universal speed-up بیان نہیں کرتے۔ سب سے بڑی efficiency نسبت GPT‑OSS throughput سے آتی ہے، جبکہ latency کی سب سے بڑی برتری DeepSeek test میں ملی؛ 1.9 اور 3.6 کو ملا کر ایک ہی workload کا مشترک نتیجہ کہنا غلط ہوگا۔
Rated power اور system power کا فرق

مرکزی efficiency ratios میں ہر accelerator کی published package rating استعمال ہوئی: Jalapeño کے لیے 700W، GB200 کے لیے 1,200W اور GB300 کے لیے 1,400W۔ Jalapeño کی آزمائشی workloads میں sustained chip power 550W یا اس سے کم ناپی گئی، لیکن مرکزی حساب میں measured value کے بجائے 700W rating رکھی گئی۔
Package rating accelerator کی حد یا درجہ بندی بیان کرتی ہے، پورے server یا rack کی دیوار سے لی گئی بجلی نہیں۔ host processors، memory، networking، power conversion اور cooling شامل کرنے کے بعد facility-level consumption بدل جاتی ہے؛ اس لیے package TDP سے نکلا throughput فی kilowatt براہ راست بجلی کے بل، فی token لاگت یا data-centre capacity کا مکمل پیمانہ نہیں۔
Tom’s Hardware کے طریقۂ موازنہ کے جائزے کے مطابق appendix میں all-in utility power فی accelerator کو Jalapeño کے لیے 1.18kW اور GB300 کے لیے 2.55kW رکھنے سے فرق نسبتاً کم ہو جاتا ہے۔ اسی جائزے میں GB300 کی multi-token prediction configuration کے مقابل Jalapeño کی peak efficiency برتری تقریباً 1.5 گنا رہتی ہے، جبکہ Vera Rubin آزمائے گئے systems میں شامل نہیں تھا۔
Single-token نتیجہ production کی پوری رفتار نہیں

مرکزی comparisons میں Jalapeño، GB200 اور GB300 نے single-token prediction استعمال کی، یعنی decoding کے ہر مرحلے میں ایک token کی پیش گوئی ہوئی۔ یہ مشترک شرط architecture کا نسبتاً صاف موازنہ دیتی ہے، مگر production deployments throughput بڑھانے کے لیے multi-token prediction یا دوسری speculative decoding techniques استعمال کر سکتی ہیں۔
اس فرق کا مطلب یہ نہیں کہ single-token tests غیر متعلق ہیں؛ وہ بتاتے ہیں کہ یکساں decoding mode میں Jalapeño نے آزمائے گئے systems کے مقابل کیسا کام کیا۔ البتہ ان سے یہ ثابت نہیں ہوتا کہ ہر optimized production stack میں برتری کی وہی نسبت برقرار رہے گی، کیونکہ software، batching، model precision اور serving policy نتیجہ بدل سکتے ہیں۔
Vera Rubin کی عدم شمولیت بھی comparison set کی واضح حد ہے۔ موجودہ نتائج صرف آزمائے گئے GB200 اور GB300 configurations پر لاگو ہوتے ہیں؛ ان سے Jalapeño کو Nvidia کی ہر موجودہ یا آئندہ inference generation سے تیز قرار نہیں دیا جا سکتا۔ Jalapeño training chip بھی نہیں، اس لیے inference نتائج کو model training performance تک پھیلانا الگ workload categories کو خلط ملط کرنا ہوگا۔
Measured silicon موجود ہے، عام دستیابی نہیں
Jalapeño محض simulation یا design target نہیں: OpenAI اسے working first-party silicon کہتا ہے اور نتائج measured hardware سے منسوب کرتا ہے۔ اس کے باوجود chip ابھی عام cloud customer کے لیے خریدنے یا provision کرنے کے قابل product نہیں؛ OpenAI نے سال کے اختتام تک اسے اپنے compute infrastructure میں deploy کرنا شروع کرنے کا منصوبہ بتایا ہے۔
Axios کی 25 اگست کی رپورٹ کے مطابق OpenAI کو 2026 میں Jalapeño پر مبنی محدود تعداد میں systems نصب ہونے اور 2027 میں زیادہ capacity ملنے کی توقع ہے۔ رپورٹ کے مطابق chip نئے models کی training کے لیے نہیں اور کمپنی فی الحال اسے دوسری کمپنیوں کو پیش کرنے کا ارادہ نہیں رکھتی۔
پاکستانی cloud، AI infrastructure اور software engineering ٹیموں کے لیے فی الحال قابلِ اعتماد نتیجہ اتنا ہے کہ Jalapeño نے مخصوص open-model tests میں کم latency اور بہتر power-normalized throughput دکھایا ہے۔ مقامی capacity planning، قابلِ خرید instance یا فی token لاگت کا فیصلہ تبھی ممکن ہوگا جب production-scale system power، مسلسل workloads، multi-token configurations اور Vera Rubin سمیت نئے platforms کے ساتھ یکساں methodology کے نتائج دستیاب ہوں۔
یہ بھی پڑھیں:
ہمارا نیوز لیٹر سبسکرائب کریں
ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔