Qwen3.8-Flash-Next खुला—Qwen4 की झलक में सिर्फ 6 अरब सक्रिय पैरामीटर

Qwen ने 26 अगस्त 2026 को Qwen3.8-Flash-Next के खुले भार जारी किए। IT之家 की रिलीज रिपोर्ट 125 अरब मुख्य पैरामीटर, अलग 51 अरब एन-ग्राम एम्बेडिंग और प्रति टोकन 6 अरब सक्रिय पैरामीटर दर्ज करती है। मॉडल Qwen4 का पूर्ण संस्करण नहीं, बल्कि उसकी वास्तुकला का प्रयोगात्मक पूर्वावलोकन है।
यह केवल भविष्य की घोषणा नहीं है: भार Hugging Face और ModelScope पर उपलब्ध हो चुके हैं। CellCog के रिलीज रिकॉर्ड ने भी 26 अगस्त की उपलब्धता, आधिकारिक FP8 संस्करण और Qwen4-पूर्वावलोकन की स्थिति की पुष्टि की। शीर्षक का “6 अरब” पूरे मॉडल का आकार नहीं, प्रत्येक टोकन पर चुनी जाने वाली सक्रिय गणना है।
125 अरब, 6 अरब और 51 अरब अलग-अलग क्या बताते हैं

Qwen3.8-Flash-Next एक अत्यंत विरल मिश्रित-विशेषज्ञ मॉडल है। मुख्य मॉडल में 125 अरब पैरामीटर हैं, लेकिन उसका राउटर प्रत्येक टोकन के लिए विशेषज्ञों का सीमित हिस्सा चुनता है; इस चरण में लगभग 6 अरब पैरामीटर सक्रिय होते हैं। इससे प्रति टोकन गणना घटती है, पर बाकी विशेषज्ञ भार संग्रहण से गायब नहीं होते।
अलग 51 अरब-पैरामीटर एन-ग्राम एम्बेडिंग तालिका स्थानीय टोकन क्रमों के लिए लुकअप मेमोरी का काम करती है। केवल मुख्य मॉडल और इस तालिका को जोड़ें तो इन दो हिस्सों में 176 अरब पैरामीटर बनते हैं, हालांकि वास्तविक चेकपॉइंट में अन्य घटक भी हो सकते हैं और डिस्क आकार संख्यात्मक प्रारूप पर निर्भर करता है। इसलिए सक्रिय पैरामीटर गति और गणना का संकेत हैं; पूरे भार और एम्बेडिंग स्थानीय मेमोरी की जरूरत बताते हैं।
आधिकारिक Hugging Face मॉडल कार्ड मूल संदर्भ सीमा 262,144 टोकन और YaRN के जरिए दस लाख टोकन तक विस्तार बताता है। वहीं Transformers, vLLM और SGLang के उपयोग विकल्प तथा Qwen Community License 1.0 का लाइसेंस चिह्न दिया गया है। यह Apache 2.0 रिलीज नहीं है; व्यावसायिक तैनाती से पहले नाम-प्रदर्शन और कुछ सेवा-आधारित उपयोगों पर लागू अलग लाइसेंस की शर्तें पढ़ना जरूरी है।
Qwen4 की झलक किन वास्तुकला बदलावों में है

नई बनावट लंबे संदर्भ की लागत घटाने के लिए पुनरावर्ती स्मृति और विरल ध्यान को मिलाती है। हर चार परतों में तीन Gated DeltaNet से पुराने संदर्भ को निश्चित आकार की अवस्था में संकुचित करती हैं, जबकि चौथी Qwen Sparse Attention के जरिए पुराने क्रम के चुने हुए हिस्सों तक पहुँचती है। Gated Residual सूचना के प्रवाह को नियंत्रित करता है और एन-ग्राम एम्बेडिंग कम अतिरिक्त गणना के साथ स्थानीय क्रमों की क्षमता बढ़ाती है।
एन-ग्राम तालिका के आवश्यक स्थान पहले से ज्ञात हो सकते हैं, इसलिए डिजाइन उसे मुख्य मेमोरी में रखकर जरूरी पंक्तियाँ असमय रूप से पहले मँगाने की अनुमति देता है। इससे GPU मेमोरी का दबाव घट सकता है, लेकिन लाभ हार्डवेयर, बैच आकार, संदर्भ लंबाई और अनुमान कार्यान्वयन पर निर्भर रहेगा। “6 अरब सक्रिय” अपने आप किसी सामान्य 6 अरब-पैरामीटर मॉडल जैसी मेमोरी आवश्यकता या गति की गारंटी नहीं देता।
इसे अभी Qwen4 कहना भ्रामक होगा। जारी चेकपॉइंट Qwen3.8 परिवार का सदस्य है और नई वास्तुकला को पूर्ण अगली पीढ़ी से पहले अनुमान ढाँचा तथा उपकरण निर्माताओं के सामने रखने का माध्यम है। अंतिम Qwen4 परिवार में कौन-से घटक और मॉडल आकार बने रहेंगे, इसकी घोषणा नहीं हुई है।
स्थानीय तैनाती अब भी बहु-GPU काम है

स्थानीय संचालन की पहली बाधा पूरे चेकपॉइंट को मेमोरी में रखना है। निष्क्रिय विशेषज्ञ बाद के टोकन पर चुने जा सकते हैं, इसलिए केवल सक्रिय हिस्से को स्थायी रूप से रखकर मॉडल नहीं चलाया जा सकता। एन-ग्राम तालिका, दृष्टि एनकोडर, अनुमान अवस्था और लंबे संदर्भ का KV कैश अलग मेमोरी लेते हैं।
vLLM की सत्यापित तैनाती विधि आधिकारिक FP8 चेकपॉइंट का आकार 172.78 GiB और BF16 चेकपॉइंट का आकार 335.28 GiB बताती है। एन-ग्राम तालिका को मुख्य मेमोरी में उतारने के लिए कम से कम 51 GB के साथ अतिरिक्त गुंजाइश चाहिए। शुरुआती विन्यास बहु-GPU NVIDIA और AMD प्रणालियों के लिए हैं; एक अकेला 262,144-टोकन अनुरोध सत्यापित नहीं किया गया और शुरुआती एन-ग्राम ऑफलोड कार्यान्वयन NVIDIA तक सीमित है।
vLLM के लिए समर्पित कंटेनर और बताए गए समानांतर विन्यास सबसे स्पष्ट सत्यापित मार्ग हैं। SGLang और Transformers के आदेश मॉडल कार्ड में मौजूद हैं, लेकिन ढाँचे की संगतता का अर्थ यह नहीं कि चेकपॉइंट एक उपभोक्ता GPU में समा जाएगा। सामुदायिक परिमाण-घटित संस्करण मेमोरी कम कर सकते हैं, पर उनकी गुणवत्ता, गति और वास्तुकला समर्थन को आधिकारिक भारों के बराबर नहीं माना जा सकता।
शुरुआती बेंचमार्क उपयोगी हैं, स्वतंत्र नहीं
Qwen की तकनीकी घोषणा में प्रकाशित निर्माता-परीक्षणों में मॉडल ने LiveCodeBench v6 पर 91.9, GPQA Diamond पर 91.7, CoWorkBench पर 73.9 और JobBench पर 55.7 स्कोर दर्ज किया। Qwen ने आधार मॉडल की तालिका में 14 में से आठ परीक्षणों पर सर्वश्रेष्ठ परिणाम का दावा भी किया है। ये आंकड़े कंपनी द्वारा चुने और चलाए गए मूल्यांकन हैं, स्वतंत्र पुनरुत्पादन नहीं।
तुलना करते समय मॉडल संस्करण, संकेत-विधि, संदर्भ सीमा, अनुमान ढाँचा और मूल्यांकन विन्यास समान होने चाहिए। खासकर कंपनी के अपने कार्य-सहायक परीक्षणों और उसके दोबारा चलाए प्रतिस्पर्धी परिणामों को बाहरी प्रयोगशाला की पुष्टि नहीं कहा जा सकता। अभी डेवलपर के लिए अधिक ठोस तथ्य खुले भारों की उपलब्धता, लाइसेंस की सीमाएँ, मूल संदर्भ सीमा और समर्थित तैनाती मार्ग हैं।
क्या स्पष्ट है और क्या अभी बाकी है
रिलीज से यह स्पष्ट है कि Qwen ने प्रति टोकन सक्रिय गणना को 6 अरब पैरामीटर तक सीमित करते हुए कहीं बड़ा विशेषज्ञ मॉडल और अलग एन-ग्राम मेमोरी रखी है। इसका संभावित लाभ चेकपॉइंट फिट होने के बाद कम गणना है, छोटा चेकपॉइंट नहीं। दस लाख टोकन संदर्भ भी YaRN विस्तार है, मूल सत्यापित सीमा नहीं।
अब स्वतंत्र गुणवत्ता परीक्षण, अलग-अलग GPU पर पुनरुत्पादित गति और लंबे संदर्भ में विश्वसनीयता के परिणाम बाकी हैं। Qwen4 की अंतिम वास्तुकला और मॉडल आकार भी घोषित नहीं हुए हैं। इसलिए Qwen3.8-Flash-Next को उपलब्ध खुले-भार प्रयोगात्मक पूर्वावलोकन मानना सटीक है—तैयार Qwen4 या छह अरब-पैरामीटर स्थानीय मॉडल मानना नहीं।
यह भी पढ़ें:
हमारे न्यूज़लेटर की सदस्यता लें
Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।