Claude अब 26% AI शोध का नेतृत्व करता है—फिर भी पूरी स्वायत्तता शून्य

Anthropic ने 17 सितंबर 2026 को प्रकाशित अपने प्रोटोटाइप मापन में बताया कि अगस्त में Claude ने उसके 26% भारित AI अनुसंधान एवं विकास कार्य का “नेतृत्व” किया और 90% से अधिक में कम-से-कम सहयोग किया। फिर भी किसी मापे गए कार्य-हिस्से में मॉडल पूरी तरह स्वायत्त नहीं था।
इसलिए 26% का अर्थ यह नहीं है कि Claude ने मनुष्यों से स्वतंत्र होकर अपने उत्तराधिकारी का एक-चौथाई हिस्सा बना लिया। 18 सितंबर की Associated Press की रिपोर्ट ने भी 17 सितंबर के खुलासे को इसी सीमा के साथ रखा: मॉडल उच्च-स्तरीय निर्देश मिलने के बाद अधिकांश कार्य पूरा कर सकता है, लेकिन मानव पर्यवेक्षण बना रहता है और पूर्ण स्वायत्तता अभी हासिल नहीं हुई है।
26% ‘नेतृत्व’ है, स्वतंत्र शोध नहीं
Anthropic ने काम को छह स्वचालन स्तरों—AL0 से AL5—में बांटा है। AL0 में AI शामिल नहीं होता; AL1 में उसकी भूमिका न्यूनतम रहती है; AL2 में वह सहायता देता है; और AL3 में निकट मानवीय निर्देशन के तहत काम के बड़े हिस्से संभालता है। कंपनी इसे “सहयोग” कहती है।
AL4 को “नेतृत्व” कहा गया है। इस स्तर पर Claude उच्च-स्तरीय निर्देश से अधिकांश कार्य आरंभ से अंत तक कर सकता है और रास्ते में आने वाली समस्याओं को संभाल सकता है, लेकिन मनुष्य निगरानी करता है तथा परिणाम को लागू करने का अंतिम निर्णय उसी के पास रहता है। AL5 में मनुष्य को कार्य शुरू कराने, उसकी प्रक्रिया संभालने या परिणाम लागू करने की जरूरत नहीं रहती—मापे गए किसी हिस्से को यह दर्जा नहीं मिला।
26% भारित काम का AL4 हिस्सा है, जबकि 90% से अधिक AL3 या उससे ऊपर का व्यापक हिस्सा है। इसलिए दोनों आंकड़ों को जोड़ना गलत होगा: नेतृत्व वाला काम सहयोग-या-उससे-ऊपर वाली श्रेणी में पहले से शामिल है। इसी तरह 90% को स्वतंत्र रूप से पूर्ण किए गए काम का अनुपात नहीं माना जा सकता।
मापन Claude की मदद से ही बनाया गया
सूचकांक के लिए जुलाई 2026 के हर सप्ताह संबंधित विभागों के 20% कर्मचारियों का यादृच्छिक नमूना लिया गया। Slack और आंतरिक दस्तावेजों से लगभग 15,000 सूक्ष्म कार्य निकाले गए, जिन्हें 542 शाखाओं वाले ढांचे और 378 अंतिम कार्य-श्रेणियों में व्यवस्थित किया गया। हर श्रेणी को उस पर लगाए गए अनुमानित मानव-समय के अनुसार भार मिला; इसलिए 26% साधारण कार्य-गिनती नहीं, जुलाई में तय काम की टोकरी पर आधारित भारित अनुपात है।
कार्य खोजने, उन्हें व्यवस्थित करने और स्वचालन स्तर तय करने में Claude का इस्तेमाल हुआ। अलग Claude निर्णायक ने उपलब्ध साक्ष्य के आधार पर श्रेणियों को AL0–AL5 दर्जा दिया। MIXED के पद्धति विश्लेषण के अनुसार, मॉडल और कर्मचारियों की रेटिंग में सटीक सहमति 59% थी, जबकि अलग कर्मचारियों के बीच यह 35% रही; एक स्तर की सीमा के भीतर सहमति 97% थी।
ये आंकड़े पद्धति को बेकार नहीं बनाते, लेकिन AL3 और AL4 की सीमा को वस्तुनिष्ठ तथ्य समझने से रोकते हैं। Anthropic भी स्वीकार करता है कि अपने मॉडल से अपने ही तंत्र का मूल्यांकन कराने पर निर्णायक मॉडल जांचे जा रहे मॉडल जैसी गलतियां दोहरा सकता है। प्रकाशित परिणाम बाहरी लेखा-परीक्षा नहीं, कंपनी का स्व-मूल्यांकित आंतरिक चित्र है।
दूसरी सीमा काम की स्थिर टोकरी है। बढ़ता सूचकांक बताता है कि जुलाई 2026 में पहचाने गए काम का कितना हिस्सा स्वचालित हुआ; वह यह नहीं मापता कि मनुष्य इस बीच कौन से नए या कठिन काम करने लगे। Anthropic ने जनवरी और जुलाई की टोकरियों की तुलना में नए काम बढ़ने का स्पष्ट संकेत नहीं पाया, फिर भी उसने टोकरी को समय-समय पर दोबारा बनाने और परिणामों का नया संस्करण जारी करने की जरूरत मानी है।
लगभग 30,000 एजेंट, लेकिन हर कार्रवाई पर निगरानी
अगस्त में Anthropic के सबसे अधिक इस्तेमाल होने वाले आंतरिक मंच पर किसी भी समय लगभग 30,000 एजेंट शोध और अभियांत्रिकी कार्य कर रहे थे। Reuters की रिपोर्ट के मुताबिक, मंच पर हर कार्रवाई निष्पादन से पहले स्वचालित निगरानी से गुजरी; महीने के एक अरब से अधिक निर्णयों में लगभग हर 47,000 में एक, यानी 0.002%, रोका गया। ये संख्याएं केवल उस मुख्य मंच को कवर करती हैं, Anthropic के सभी आंतरिक तंत्रों को नहीं।
यह निगरानी AL पैमाने से अलग माप है। AL4 बताता है कि किसी कार्य को पूरा करने में मॉडल और मनुष्य की भूमिकाएं कैसे बंटी हैं; कार्रवाई रोकने वाला तंत्र यह देखता है कि एजेंट निर्धारित सीमाओं के भीतर काम कर रहा है या नहीं। कम अवरोध दर पूर्ण सुरक्षा का प्रमाण नहीं है—वह केवल उन कार्रवाइयों का अनुपात बताती है जिन्हें मौजूदा निगरानी नियमों ने रोका।
ऑनलाइन निगरानी के साथ बाद में गतिविधियां जांचने वाला अलग तंत्र भी है। अवरुद्ध कार्रवाइयां मानवीय समीक्षा तक जाती हैं, जिससे स्पष्ट है कि बड़े पैमाने पर एजेंट चलने के बावजूद नियंत्रण पूरी तरह मॉडल को नहीं सौंपा गया है।
स्व-सुधार का संकेत है, प्रमाण नहीं
इन मापों का ठोस निष्कर्ष सीमित लेकिन महत्वपूर्ण है: Claude अब Anthropic के मॉडल-विकास कार्य में केवल सहायक नहीं रहा; भारित काम के एक हिस्से में वह मुख्य निष्पादक है। इसके बावजूद शोध की दिशा तय करना, काम सौंपना, पर्यवेक्षण और परिणाम लागू करना अभी मानवीय जिम्मेदारी है।
AL5 पर शून्य हिस्सेदारी के कारण यह परिणाम पूर्ण स्वायत्त पुनरावर्ती स्व-सुधार का प्रमाण नहीं देता। वह Anthropic के भीतर बढ़ते स्वचालन का कंपनी-निर्धारित संकेतक है—न कि यह सबूत कि Claude बिना मानवीय हस्तक्षेप अपना उत्तराधिकारी बना सकता है।
दूसरी अग्रणी प्रयोगशालाओं ने अभी इसी पद्धति से तुलनीय आंकड़े प्रकाशित नहीं किए हैं, इसलिए 26% के आधार पर Claude को प्रतिद्वंद्वी मॉडलों से अधिक स्वायत्त नहीं कहा जा सकता। आगे दावे की विश्वसनीयता इस बात पर निर्भर करेगी कि Anthropic नियमित संस्करण जारी करता है या नहीं, बाहरी मूल्यांकनकर्ताओं को पर्याप्त आंतरिक साक्ष्य मिलता है या नहीं, और क्या स्वतंत्र जांच समान स्वचालन स्तर निकालती है।
यह भी पढ़ें:
हमारे न्यूज़लेटर की सदस्यता लें
Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।