शुरुआती लोगों के लिए

GPT-6 Astra या Claude Fable 5.1—समान दर, नतीजे अलग

|लेखक: QUASA संपादकीय टीम|6 मिनट पढ़ने का समय| 3
GPT-6 Astra या Claude Fable 5.1—समान दर, नतीजे अलग

सीधा उत्तर: सार्वजनिक स्वतंत्र अंकों में सबसे ऊँची कोडिंग और सामान्य बुद्धिमत्ता चाहिए तो Claude Fable 5.1 आगे है; कम टोकन में मजबूत प्रदर्शन प्राथमिकता हो तो GPT-6 Astra बेहतर शुरुआती उम्मीदवार है। दोनों की मानक API दर प्रति दस लाख इनपुट टोकन $10 और आउटपुट टोकन $50 है, लेकिन कैश, आउटपुट की लंबाई और पुनःप्रयास वास्तविक बिल अलग कर देते हैं।

इसलिए किसी छोटे व्यवसाय के लिए सार्वभौमिक विजेता घोषित करना उचित नहीं होगा। कोडिंग में प्रकाशित अंतर केवल तीन अंक है और अलग एजेंट व्यवस्थाओं से आया है; सामान्य बुद्धिमत्ता में Fable 5.1 आगे है, जबकि Astra की टोकन दक्षता मजबूत है। अंतिम फैसला प्रति दस लाख टोकन की दर पर नहीं, प्रति सफल कार्य लागत पर होना चाहिए।

समान दर केवल बिल की शुरुआती पंक्ति है

समान दस्तावेज़ अनुरोध में GPT-6 Astra और Claude Fable 5.1 की कैश-पठन तथा अंतिम लागत का अंतर

OpenAI के आधिकारिक मॉडल विवरण में GPT-6 Astra की दर $10 प्रति दस लाख नए इनपुट, $1 कैश किए गए इनपुट और $50 आउटपुट टोकन है। इसका संदर्भ विस्तार 10.5 लाख और अधिकतम आउटपुट 1.28 लाख टोकन है। 2.72 लाख से अधिक इनपुट वाले अनुरोध पर पूरे अनुरोध की इनपुट और कैश दर दोगुनी तथा आउटपुट दर डेढ़ गुनी हो जाती है।

Claude Fable 5.1 के आधिकारिक विनिर्देश भी $10 इनपुट और $50 आउटपुट की मानक दर बताते हैं, पर कैश-पठन की दर केवल $0.25 प्रति दस लाख टोकन है। पाँच मिनट के कैश-लेखन की दर $12.50 और एक घंटे की $20 है; संदर्भ विस्तार दस लाख तथा अधिकतम आउटपुट 1.28 लाख टोकन है। इसीलिए शीर्षक में समान दर का अर्थ समान मूल इनपुट और आउटपुट मूल्य है, समान अंतिम खर्च नहीं।

एक स्पष्ट सशर्त उदाहरण में 50,000 नए इनपुट, 200,000 कैश-पठन और 20,000 आउटपुट टोकन मानें। कैश-लेखन, औजार और अन्य शुल्क छोड़ने पर Astra का खर्च $1.70 और Fable 5.1 का $1.55 होगा। यदि पूरा संदर्भ हर बार नया भेजा जाता है या Astra का अनुरोध 2.72 लाख इनपुट की सीमा पार करता है, तो यही गणना बदल जाएगी।

कोडिंग में 70 बनाम 67 है, लेकिन यह शुद्ध मॉडल मुकाबला नहीं

अलग एजेंट संयोजनों में GPT-6 Astra और Claude Fable 5.1 के कोडिंग परिणाम और टोकन उपयोग

Artificial Analysis के कोडिंग एजेंट मापन में GPT-6 Astra ने Codex व्यवस्था में 67 और Claude Fable 5.1 ने Claude Code व्यवस्था में 70 अंक पाए। तीन अंकों की बढ़त Fable 5.1 के पक्ष में है, पर मॉडल के साथ एजेंट ढाँचा भी बदला था; इसलिए इसे समान औजारों पर मूल मॉडलों का नियंत्रित आमना-सामना नहीं कहा जा सकता।

उसी मापन में Astra ने अपने पूर्ववर्ती GPT-5.6 Sol के अधिकतम प्रयास की तुलना में लगभग एक-तिहाई टोकन इस्तेमाल किए। यह Fable 5.1 के मुकाबले प्रत्यक्ष टोकन अनुपात नहीं है, इसलिए इससे अपने-आप यह निष्कर्ष नहीं निकलता कि Astra हर कोडिंग कार्य में सस्ता होगा। फिर भी अधिक मात्रा वाले नियमित सुधार, परीक्षण और छोटे बदलावों में वह मजबूत लागत-सचेत उम्मीदवार है; सबसे कठिन लंबे स्वायत्त सत्रों में Fable 5.1 का ऊँचा मापा अंक पहले जाँचने का कारण देता है।

सामान्य बुद्धिमत्ता में Fable आगे, पर अंक का संस्करण देखें

Fable 5.1 के स्वतंत्र मूल्यांकन में अधिकतम प्रयास पर सामान्य बुद्धिमत्ता सूचकांक 66 था; उसी सूचकांक संस्करण में Astra का प्रकाशित अंक 61 था। Fable का परीक्षण Anthropic के मूल सर्वर-पक्ष वैकल्पिक मॉडल विकल्प के साथ हुआ था, जिसने सुरक्षा-संकेत वाले अनुरोधों के लगभग 4% आउटपुट टोकन Claude Opus 4.8 या Claude Opus 5 से दिए। इसलिए 66 पूरे परोसे गए विन्यास का परिणाम है, अकेले पृथक मॉडल का बिना शर्त अंक नहीं।

उस मूल्यांकन में Fable 5.1 का अधिकतम प्रयास प्रति सूचकांक कार्य $3.76 पड़ा। अत्यधिक प्रयास पर अंक 65 और लागत $2.72 थी—एक अंक कम, लेकिन प्रति कार्य $1.04 की बचत। ये Artificial Analysis के परीक्षण-संग्रह की लागतें हैं, किसी व्यवसाय के अपने दस्तावेज़ या कोड परिवर्तन की तय कीमत नहीं।

अंकों को स्थायी पैमाना मानना भी जोखिमपूर्ण है। सूचकांक संस्करण 4.2 की कार्यप्रणाली ने निजी परीक्षणों का भार 40% किया, नए ज्ञान-कार्य और लंबे दस्तावेज़ परीक्षण जोड़े तथा एक पुराने वैज्ञानिक परीक्षण को हटाया। नए संस्करण में भी Fable 5.1 पहले और Astra दूसरे स्थान पर रहा, पर 66 और 61 पुराने संस्करण के सटीक अंक हैं; अलग संस्करणों के अंक सीधे मिलाना उचित नहीं है।

चार कामों के लिए अलग चुनाव

चार व्यावसायिक कार्यों में सफलता और प्रति-कार्य लागत के आधार पर दोनों मॉडलों का चुनाव
  • नियमित कोड भंडार सुधार: Astra से परीक्षण शुरू करें, खासकर जब कार्यों की संख्या अधिक हो और टोकन खर्च महत्वपूर्ण हो। फिर भी Fable 5.1 को उसी भंडार, औजार और समय-सीमा पर चलाए बिना तीन अंकों के अंतर को खारिज न करें।
  • लंबे स्वायत्त कोडिंग सत्र: Fable 5.1 को प्राथमिक उम्मीदवार रखें। स्वतंत्र कोडिंग व्यवस्था में उसका अंक ऊँचा है, लेकिन स्वीकार किए गए बदलाव, विफल पुनःप्रयास और कुल आउटपुट टोकन साथ मापें।
  • जटिल शोध और निर्णय-पत्र: Fable 5.1 अधिक आशाजनक है क्योंकि सामान्य बुद्धिमत्ता मापन में वह आगे रहा। संवेदनशील निर्णयों में वैकल्पिक मॉडल से आए आउटपुट और मानवीय समीक्षा को लागत तथा गुणवत्ता अभिलेख में अलग रखें।
  • बार-बार पढ़े जाने वाले लंबे दस्तावेज़: Fable 5.1 की कम कैश-पठन दर लाभ दे सकती है। लाभ तभी टिकेगा जब संदर्भ वास्तव में कैश से मिले; बार-बार बदलते निर्देश, कैश-लेखन और छोटे पुनःउपयोग अंतर को घटा सकते हैं।

छोटे व्यवसाय का निर्णायक हिसाब

दोनों मॉडलों के लिए 30–50 पहचान-मुक्त वास्तविक कार्यों का एक स्थिर परीक्षण-संग्रह पर्याप्त शुरुआती नमूना हो सकता है। प्रयास स्तर, उपलब्ध औजार, समय-सीमा और स्वीकार्यता की शर्त समान रखें। कोडिंग में परीक्षण पास होना और समीक्षा में बदलाव स्वीकार होना अलग दर्ज करें; दस्तावेज़ कार्य में तथ्य, पूर्णता तथा आवश्यक प्रारूप को अलग मापें।

हर प्रयास में नया इनपुट, कैश-पठन, कैश-लेखन, आउटपुट, पुनःप्रयास और मानवीय समीक्षा का समय जोड़ें। फिर कुल API तथा समीक्षा खर्च को स्वीकार किए गए परिणामों की संख्या से भाग दें। यही प्रति सफल कार्य लागत विफल उत्तर, अनावश्यक लंबा आउटपुट और दोबारा चलाने का वह खर्च दिखाती है जिसे समान $10/$50 दर छिपा देती है।

व्यावहारिक चुनाव इस प्रकार है: अधिकतम प्रकाशित क्षमता के लिए Fable 5.1, टोकन-सचेत मजबूत प्रदर्शन के लिए Astra। यदि कामों का मिश्रण बड़ा है, तो नियमित कोडिंग Astra और कठिन विश्लेषण Fable 5.1 को देना उपयोगी हो सकता है—लेकिन केवल तब, जब दो एकीकरणों, मार्ग-निर्धारण और निगरानी की परिचालन लागत उससे होने वाली बचत से कम हो।

यह भी पढ़ें:

साझा करें:

हमारे न्यूज़लेटर की सदस्यता लें

Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।

0