प्रौद्योगिकी

Gemini 3.7 Flash तेज ही नहीं—स्वतंत्र परीक्षण में कार्य लागत 30% घटी

|लेखक: QUASA संपादकीय टीम|6 मिनट पढ़ने का समय| 21
Gemini 3.7 Flash तेज ही नहीं—स्वतंत्र परीक्षण में कार्य लागत 30% घटी

सीधा निष्कर्ष: उच्च तर्क स्तर पर Gemini 3.7 Flash ने Gemini 3.6 Flash से बेहतर गुणवत्ता के साथ कम प्रति-कार्य लागत दर्ज की। Artificial Analysis के स्वतंत्र माप में 30% कम लागत के साथ प्रति Intelligence Index कार्य 0.40 USD, औसत कार्य-अवधि 1.7 मिनट और लगभग 340 आउटपुट टोकन प्रति सेकंड दर्ज हुए; Intelligence Index स्कोर 56 था, जबकि 3.6 Flash का स्कोर 52 रहा।

इस परिणाम का प्रमुख प्रतिबंध कीमत है। Google DeepMind के मॉडल कार्ड में प्रकाशित दरें 31 दिसंबर 2026 तक प्रति दस लाख इनपुट और आउटपुट टोकन क्रमशः 0.75 और 3.75 USD हैं; 1 जनवरी 2027 से ये 1.50 और 7.50 USD हो जाएंगी। इसलिए स्वतंत्र परीक्षण में दिखी लागत बढ़त उपयोगी है, लेकिन उसे स्थायी API बजट मानना उचित नहीं होगा।

कम लागत किस चीज पर मापी गई

यह प्रत्येक API अनुरोध पर मिलने वाली छूट नहीं है। तुलना Intelligence Index के निर्धारित कार्यों, उच्च तर्क विन्यास और परिचयात्मक टोकन दर पर निकली प्रति-कार्य लागत की है। इसका अर्थ है कि परीक्षण में मॉडल ने गुणवत्ता, खर्च और कार्य पूरा करने के समय का बेहतर संयोजन दिया—यह नहीं कि हर उत्पादन कार्यप्रवाह का कुल खर्च उसी अनुपात में घटेगा।

प्रति-टोकन दर केवल भेजे और उत्पन्न किए गए टोकन का शुल्क बताती है। प्रति-कार्य लागत में यह भी असर डालता है कि उत्तर तक पहुंचने में कितने तर्क टोकन लगे, आउटपुट कितना लंबा था और कार्य सफल हुआ या नहीं। वास्तविक व्यवस्था में पुनःप्रयास, उपकरण कॉल, कैशिंग, त्रुटि-सुधार और मानव समीक्षा अंतिम खर्च बदल सकते हैं।

यही कारण है कि नए और पुराने मॉडल की समान टोकन कीमत होने पर भी उनकी प्रति-कार्य लागत अलग हो सकती है। यदि नया मॉडल कम टोकन या कम पुनःप्रयास में सफल उत्तर देता है, तो समान दर पर भी पूरा कार्य सस्ता पड़ता है। स्वतंत्र नतीजा इसी प्रभाव को मापता है, न कि बिल पर लागू किसी सार्वभौमिक छूट को।

आधिकारिक दर और स्वतंत्र माप को अलग रखें

समान उच्च तर्क परीक्षण में Gemini 3.7 Flash और 3.6 Flash की बुद्धिमत्ता, कार्य-अवधि और प्रति-कार्य लागत की तुलना
  • स्वतंत्र गुणवत्ता और गति: निर्धारित कार्य-समूह पर मॉडल की उत्तर-गुणवत्ता, उत्पादन गति और औसत कार्य-अवधि मापी गई।
  • स्वतंत्र कार्य लागत: परीक्षण में इस्तेमाल हुए टोकन और उस समय लागू मूल्य को जोड़कर एक मूल्यांकन कार्य का खर्च निकाला गया।
  • आधिकारिक API मूल्य: इनपुट और आउटपुट टोकन की प्रकाशित दर है; यह किसी कार्य के सफल होने की गारंटी या उसका पूरा खर्च नहीं बताती।
  • समयबद्ध प्रतिबंध: परिचयात्मक अवधि खत्म होने पर समान टोकन मात्रा का आधार शुल्क दोगुना होगा।

इन मापों को एक संयुक्त अंक में बदलना भ्रामक होगा। आधिकारिक परीक्षण, स्वतंत्र Intelligence Index और किसी दल का उत्पादन कार्यप्रवाह अलग कार्य-समूह, तर्क स्तर, उपकरण और सफलता मानदंड इस्तेमाल कर सकते हैं। सही तुलना तभी बनती है जब एक ही संकेत, समान तर्क विन्यास और समान आउटपुट शर्तों पर दोनों मॉडल चलाए जाएं।

दस्तावेज और स्वचालन में बढ़त कितनी उपयोगी है

Gemini 3.7 Flash द्वारा स्प्रेडशीट और जटिल दस्तावेज से उत्तर निकालने का स्वतंत्र परीक्षण

स्वतंत्र परीक्षण में AA-AnalystAgent पर 60% और AutomationBench-AA पर 62.7% अंक मिले। पहला जटिल स्प्रेडशीट और दस्तावेजों से प्रश्नों के उत्तर निकालने की क्षमता देखता है; दूसरा अनुरूपित व्यावसायिक सॉफ्टवेयर वातावरण में उपकरण चलाकर काम पूरा करने की क्षमता मापता है। इससे रिपोर्ट विश्लेषण, संरचित अभिलेखों से तथ्य निकालने और अनुप्रयोग स्वचालन जैसे कार्य स्थानांतरण परीक्षण के मजबूत उम्मीदवार बनते हैं।

ये अंक किसी कंपनी की अपनी फाइलों पर शुद्धता सिद्ध नहीं करते। दस्तावेज का आकार, तालिकाओं की बनावट, स्रोत-संदर्भ की आवश्यकता और स्वीकार्य त्रुटि दर नतीजा बदल सकते हैं। बड़ी संदर्भ सीमा किसी लंबी फाइल को स्वीकार करने में मदद करती है, लेकिन सही उद्धरण, पूर्ण तथ्य-संगति या निर्धारित प्रारूप अपने आप सुनिश्चित नहीं करती।

कम तर्क वाले वर्गीकरण, छोटे सारांश और अधिक मात्रा वाले सरल अनुरोधों में तस्वीर अलग हो सकती है। ऐसे कार्यों में औसत विलंब, कुल आउटपुट टोकन और त्रुटि के बाद होने वाला पुनःप्रयास Intelligence Index की औसत लागत से अधिक उपयोगी संकेतक हो सकते हैं।

कोडिंग के अंक अलग परीक्षणों से आते हैं

Google की आधिकारिक लॉन्च तुलना में Gemini 3.7 Flash ने FrontierCode 1.1 Main पर 43.6% बनाम 34.4%, WebDev Arena में 1588 बनाम 1538 Elo, विशेषज्ञ PDF समझ के GDP.pdf परीक्षण में 34.0% बनाम 22.0% और AutomationBench में 30.4% बनाम 17.0% प्राप्त किया। ये परिणाम क्रमशः उत्पादन कोड, वेब विकास, जटिल दस्तावेज समझ और व्यावसायिक स्वचालन में 3.6 Flash पर बढ़त का संकेत देते हैं।

इन आधिकारिक अंकों को स्वतंत्र लागत परिणाम का दूसरा प्रमाण नहीं माना जा सकता। यहां कार्य-समूह और अंक प्रणालियां अलग हैं तथा प्रति सफल कार्य खर्च नहीं मापा गया। इसी तरह AutomationBench और AutomationBench-AA नाम में समान दिखते हैं, लेकिन उनके प्रतिशतों को घटाकर गुणवत्ता की बढ़त निकालना गलत होगा।

कोडिंग दल के लिए प्रकाशित अंक मॉडल को परीक्षण में शामिल करने का आधार देते हैं, सीधे स्थानांतरण का नहीं। वास्तविक अंतर भंडार के आकार, परीक्षण चलाने की क्षमता, उपकरण अनुमति, पैच स्वीकार्यता और मानव समीक्षा पर निर्भर करेगा। विशेष रूप से लंबे सॉफ्टवेयर कार्यों में तेज टोकन उत्पादन तभी लाभ देता है जब अंतिम बदलाव सही हो और अतिरिक्त सुधार चक्र न बढ़ें।

मानक दर लागू होने पर बजट का असर

समान Gemini 3.7 Flash टोकन उपयोग पर परिचयात्मक और जनवरी 2027 की मानक लागत का अंतर

समान इनपुट और आउटपुट मात्रा रखने पर आधार टोकन शुल्क दोगुना हो जाएगा। एक स्पष्ट काल्पनिक गणना में, मासिक उपयोग 10 करोड़ इनपुट और 1 करोड़ आउटपुट टोकन हो तो परिचयात्मक दर पर शुल्क 112.50 USD और मानक दर पर 225 USD बनेगा। इसमें कैशिंग, उपकरण, नेटवर्क, मध्यस्थ प्रदाता या मानव समीक्षा का खर्च शामिल नहीं है।

फिर भी प्रति सफल कार्य लागत का ठीक दोगुना होना अनिवार्य नहीं है। यदि Gemini 3.7 Flash पुराने मॉडल की तुलना में कम पुनःप्रयास, छोटा आउटपुट या कम समीक्षा मांगता है, तो ऊंची टोकन दर के बाद भी कुछ कार्यों में लाभ बच सकता है। उलटी स्थिति में लंबा तर्क या अधिक उपकरण कॉल स्वतंत्र परीक्षण में दिखी बचत को समाप्त कर सकते हैं।

निर्णय का उपयोगी आधार कुल API बिल नहीं, स्वीकार किए गए सफल कार्य की लागत है। समान कार्यों पर सफलता अनुपात, इनपुट-आउटपुट टोकन, कार्य-अवधि, पुनःप्रयास और समीक्षा समय साथ दर्ज करने से स्पष्ट होगा कि लाभ मॉडल की बेहतर क्षमता से आ रहा है या अस्थायी परिचयात्मक मूल्य से। बजट को दोनों दरों पर देखने पर ही गति, गुणवत्ता और दीर्घकालिक खर्च अलग-अलग समझ में आते हैं।

यह भी पढ़ें:

साझा करें:

हमारे न्यूज़लेटर की सदस्यता लें

Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।

0