OpenAI का Jalapeño तेज निकला—पर NVIDIA की जगह अभी नहीं लेगा

OpenAI के 25 अगस्त 2026 के आधिकारिक परिणामों में उसके पहले कस्टम अनुमान त्वरक Jalapeño ने GPT‑OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T पर तुलना वाली NVIDIA प्रणालियों से अधिक प्रवाह और कम विलंबता दिखाई। तीनों मॉडल में शीर्ष प्रवाह पर प्रति वाट AI कार्य 1.5 से 1.9 गुना अधिक और सिरे-से-सिरे विलंबता 1.7 से 3.6 गुना कम रही।
यह बढ़त वास्तविक मापों पर आधारित है, लेकिन इसका अर्थ NVIDIA का पूर्ण विकल्प मिल जाना नहीं है। प्रकाशित परीक्षण केवल अनुमान कार्य, चुने हुए खुले मॉडल और इंजीनियरिंग नमूनों पर केंद्रित थे; इनमें मॉडल प्रशिक्षण, Vera Rubin के साथ प्रत्यक्ष परीक्षण और सामान्य उत्पादन के लंबे, बहु-चरण अनुरोध शामिल नहीं थे। इसलिए Jalapeño OpenAI की NVIDIA पर निर्भरता का एक हिस्सा घटा सकता है, उसे फिलहाल समाप्त नहीं कर सकता।
InferenceX ने बढ़त किस आधार पर मापी

InferenceX ने केवल चिप की सैद्धांतिक गणना क्षमता नहीं देखी। परीक्षण ने अलग-अलग संचालन बिंदुओं पर उपलब्ध बिजली के अनुपात में प्रवाह, प्रत्येक उपयोगकर्ता की टोकन दर और पूरा अनुरोध समाप्त होने तक का समय मापा। इससे एक साथ दो प्रश्नों का उत्तर मिलता है: सीमित बिजली में प्रणाली कितना काम कर सकती है और उपयोगकर्ता को उत्तर कितनी जल्दी मिलता है।
प्रकाशित मुख्य परीक्षणों में नाममात्र 8,000 इनपुट और 1,000 आउटपुट टोकन वाला एकल-चरण भार था। GPT‑OSS 120B के लिए Jalapeño की तुलना GB200 से हुई, जबकि DeepSeek R1 670B और Kimi K2.5 1T के सामने GB300 विन्यास रखे गए। दोनों पक्षों पर एकल-टोकन पूर्वानुमान इस्तेमाल होने के कारण मुख्य तुलना इस विशेष तकनीकी आधार पर समान थी।
फिर भी 1.5 से 1.9 गुना दक्षता बढ़त को हर सेवा पर लागू नहीं किया जा सकता। मॉडल, संख्यात्मक प्रारूप, अनुरोध का आकार, बैच, सॉफ्टवेयर और चुना गया संचालन बिंदु बदलने पर परिणाम भी बदल सकता है। परीक्षण यह दिखाता है कि Jalapeño इन निर्धारित परिस्थितियों में दक्ष था; यह हर NVIDIA प्रणाली पर सार्वभौमिक जीत सिद्ध नहीं करता।
चार माप अलग रखने पर तुलना साफ होती है

Tom’s Hardware की संख्यात्मक समीक्षा के अनुसार मुख्य सामान्यीकरण में Jalapeño के लिए 700 वाट, GB200 के लिए 1,200 वाट और GB300 के लिए 1,400 वाट की प्रकाशित पैकेज शक्ति ली गई। परीक्षणों में Jalapeño की लगातार मापी गई खपत 550 वाट या उससे कम थी, जबकि पूरी सुविधा के आधार पर प्रति त्वरक 1.18 किलोवाट और GB300 के लिए 2.55 किलोवाट का अनुमान इस्तेमाल हुआ।
- प्रति किलोवाट प्रवाह: शीर्ष संचालन बिंदुओं पर Jalapeño ने 1.5 से 1.9 गुना अधिक AI कार्य दिया। यह बिजली के अनुपात में दक्षता बताता है, किसी पूरे बेड़े का कुल प्रवाह नहीं।
- सिरे-से-सिरे विलंबता: अनुरोध पूरा होने का समय मॉडल के अनुसार 1.7 से 3.6 गुना कम था। सबसे बड़ा अनुपात हर मॉडल और हर प्रवाह स्तर पर लागू नहीं होता।
- पैकेज शक्ति: 700, 1,200 और 1,400 वाट की रेटिंग केवल त्वरक पैकेजों को सामान्य आधार देती है। इसमें पूरे सर्वर और डेटा केंद्र की अतिरिक्त खपत शामिल नहीं होती।
- कुल सुविधा-शक्ति: सर्वर, शीतलन और बिजली-वितरण जोड़ने पर Jalapeño और GB300 के बीच दक्षता अंतर पैकेज-शक्ति वाली तुलना से संकरा हो जाता है।
इन मापों को मिलाकर देखने पर सबसे मजबूत निष्कर्ष ऊर्जा-सीमित अनुमान सेवा के बारे में निकलता है। क्लाउड ग्राहक की वास्तविक लागत में त्वरक के अलावा नेटवर्क, स्मृति, उपयोग दर, सहायक सर्वर, शीतलन, सॉफ्टवेयर परिपक्वता और पूंजीगत खर्च भी जुड़ते हैं। प्रकाशित परिणाम इन सभी मदों की पूर्ण लागत तुलना नहीं हैं।
प्रयोगशाला सत्यापन ने क्या देखा और क्या नहीं

SemiAnalysis के प्रयोगशाला विवरण के मुताबिक उसके विश्लेषकों ने OpenAI के इंजीनियरों के साथ InferenceX परीक्षण चलते हुए सत्यापित किए, लेकिन संख्याएं OpenAI ने उपलब्ध कराईं और विश्लेषकों ने पूरा परीक्षण-संग्रह स्वयं नहीं चलाया। उन्होंने AgentX के परिणाम भी नहीं देखे; फिलहाल उपलब्ध नमूने इंजीनियरिंग स्तर के हैं और उत्पादन मात्रा 2027 में धीरे-धीरे बढ़ाने की योजना है।
यह सीमा सामान्य उत्पादन भार के लिए महत्वपूर्ण है। नाममात्र 8k/1k वाला एकल-चरण अनुरोध लंबे संदर्भ और कई संवाद चरणों में अनुरोध मार्गन, प्रीफिक्स कैश, कैश प्रबंधन तथा बाहरी स्मृति पर पड़ने वाले दबाव को नहीं मापता। चुने हुए भार पर दर्ज बढ़त को लंबे उत्पादन कार्यप्रवाह में उसी अनुपात से दोहराया हुआ मानने के लिए अभी पर्याप्त सार्वजनिक प्रमाण नहीं है।
बहु-टोकन पूर्वानुमान भी तस्वीर बदलता है। मुख्य समान-आधार तुलना में Jalapeño और GB300 दोनों एकल-टोकन पद्धति पर चले, जबकि NVIDIA के कई उत्पादन विन्यास एक साथ कई भावी टोकन का अनुमान लगा सकते हैं। बहु-टोकन पूर्वानुमान वाले GB300 के विरुद्ध वैकल्पिक तुलना में Jalapeño की शीर्ष ऊर्जा-दक्षता बढ़त लगभग 1.5 गुना तक सिमट गई।
NVIDIA पर निर्भरता कितनी घट सकती है
Jalapeño की सीधी भूमिका अनुमान सेवाओं में है। यह नए अग्रणी मॉडल प्रशिक्षित करने के लिए बनाया गया त्वरक नहीं है, इसलिए OpenAI को प्रशिक्षण के लिए NVIDIA और दूसरे साझेदारों के हार्डवेयर की जरूरत बनी रहेगी। अनुमान में भी अलग मॉडल परिवारों, सॉफ्टवेयर अनुकूलता और तेजी से बढ़ती क्षमता मांग के कारण एक ही कस्टम चिप पूरी आपूर्ति नहीं संभालता।
दूसरी सीमा पीढ़ीगत तुलना की है। मुख्य तालिकाओं में NVIDIA के GB200 और GB300 विन्यास थे, Vera Rubin नहीं। अलग तारीख, अलग मॉडल और अलग सॉफ्टवेयर से प्रकाशित Rubin आंकड़ों को Jalapeño के परिणामों के पास रखा जा सकता है, लेकिन वह समान प्रयोगशाला, समान भार और समान संचालन बिंदु वाला प्रत्यक्ष परीक्षण नहीं होगा।
फिलहाल Jalapeño काम करता हुआ इंजीनियरिंग सिलिकॉन है, सामान्य क्लाउड ग्राहकों के लिए उपलब्ध उत्पाद नहीं। अगला निर्णायक प्रमाण नियोजित आंतरिक तैनाती, बड़े उत्पादन बेड़े, लंबे बहु-चरण भार और Vera Rubin के साथ समान-आधार परीक्षण से आएगा। तब तक सही निष्कर्ष सीमित है: OpenAI ने अनुमान दक्षता में मजबूत शुरुआती बढ़त दिखाई है, लेकिन उसका व्यापक संगणन ढांचा अभी NVIDIA के बिना नहीं चल सकता।
यह भी पढ़ें:
हमारे न्यूज़लेटर की सदस्यता लें
Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।