
Claude اب 26٪ AI تحقیق کی قیادت کرتا ہے، مکمل خودمختاری پھر بھی صفر

Anthropic نے 17 ستمبر 2026 کو ایک ابتدائی R&D Automation Index جاری کیا جس کے اگست کے نتائج میں Claude کمپنی کی 26٪ AI تحقیق و ترقی میں انسانی نگرانی کے تحت ”قیادت“ کرتا دکھائی دیا۔ Associated Press کی 18 ستمبر کی رپورٹ کے مطابق اس درجے پر Claude بلند سطح کی ہدایت ملنے کے بعد بیشتر کام ابتدا سے اختتام تک مکمل کر سکتا ہے، لیکن مکمل خودمختار نہیں ہے۔
اسی اگست کی پیمائش میں 90٪ سے زیادہ کام کم از کم تعاون کی سطح پر تھا، جبکہ کوئی ناپا گیا حصہ انسان کو مکمل طور پر عمل سے نکالنے والی سطح تک نہیں پہنچا۔ اس لیے 26٪ کا مطلب یہ نہیں کہ Claude نے اپنے جانشین کی تحقیق اور تیاری خود سنبھال لی؛ یہ Anthropic کے اندرونی کام کا انسانی وقت سے وزن دیا گیا، زیرِ نگرانی پیمانہ ہے۔
26٪، 90٪ اور صفر کیا ناپتے ہیں
یہ تینوں اعداد ایک ہی دعوے کے مختلف رخ ہیں۔ 26٪ اس weighted کام کو ظاہر کرتا ہے جسے AL4 یا ”AI leads“ ملا: انسان مسئلہ یا بلند سطح کی ہدایت دیتا ہے، Claude بیشتر task خود آگے بڑھاتا ہے، مگر نتیجے کی نگرانی اور آخری اختیار انسان کے پاس رہتے ہیں۔ یہ Anthropic کے ملازمین، تمام تحقیقی منصوبوں یا Claude کے لکھے ہوئے code کا فیصد نہیں ہے۔
90٪ سے زیادہ ایک وسیع حد ہے، کیونکہ اس میں AL3 یعنی ”AI collaborates“ اور اس سے بلند درجے شامل ہیں۔ AL3 پر Claude قریبی انسانی رہنمائی میں کام کے بڑے حصے انجام دے سکتا ہے؛ لہٰذا اس عدد سے وسیع استعمال ثابت ہوتا ہے، آزادانہ اختیار نہیں۔
صفر مکمل خودمختاری سب سے اہم حد ہے۔ AL5 پر AI کو مسئلہ خود محسوس کرنا، کام کا دائرہ طے کرنا، حل بنانا، جانچنا اور انسانی شمولیت کے بغیر اسے عملی نظام میں نافذ کرنا ہوگا۔ اگست کے کسی measured subset نے یہ درجہ حاصل نہیں کیا، اس لیے سرخی میں ”قیادت“ سے مراد supervised lead ہے، خودکار self-improvement نہیں۔
AL0 سے AL5 تک فرق
Anthropic کی اصل پیمائشی رپورٹ چھ Automation Levels بیان کرتی ہے: AL0 پر AI شامل نہیں، AL1 پر معمولی استعمال، AL2 پر معاونت، AL3 پر قریبی انسانی ہدایت میں تعاون، AL4 پر بلند سطح کی ہدایت کے بعد بیشتر کام کی قیادت، اور AL5 پر انسان کے بغیر مکمل خودمختار عمل۔ موجودہ 26٪ AL4 کے حصے کی نمائندگی کرتا ہے، AL5 کی نہیں۔
رپورٹ رات کے وقت ناکام ہونے والی data pipeline کی مثال سے AL4 اور AL5 کی حد واضح کرتی ہے۔ AL4 پر Claude خرابی ڈھونڈ سکتا، fix لکھ اور آزما سکتا اور تبدیلیوں کی وضاحت تیار کر سکتا ہے، مگر engineer طے کرے گا کہ fix deploy ہو؛ AL5 پر نظام خرابی خود دریافت کرکے اسی انسانی مداخلت کے بغیر deployment تک پہنچے گا۔
یہ فرق پالیسی اور تحقیق دونوں کے لیے بنیادی ہے۔ AL4 کام کی رفتار بڑھا سکتا ہے اور انسانی محقق کو مسلسل ساتھ رہنے سے بچا سکتا ہے، لیکن ترجیحات، قبولیت، deployment اور احتساب انسان کے پاس رہ سکتے ہیں۔ اسی لیے ”lead“ کو ”autonomous“ کہنا index کی اپنی تعریف کے خلاف ہوگا۔
انڈیکس کیسے بنایا گیا
Anthropic نے جولائی 2026 کے ہر ہفتے model R&D loop کے ہر شعبے سے 20٪ عملے کا random sample لیا۔ Claude research agent نے Slack اور اندرونی دستاویزات سے ان افراد کے تقریباً 15,000 باریک tasks اخذ کیے، پھر انہیں 542 nodes کے درخت میں منظم کیا؛ ان میں 378 آخری درجے کی categories تھیں۔ اس درخت کو منجمد کیا گیا تاکہ بعد کی ماہانہ پیمائشیں ایک ہی بنیادی task basket کے مقابل ہوں۔
ہر category پر ایک Claude agent نے شواہد جمع کیے اور ایک الگ Claude judge نے AL0 سے AL5 تک درجہ دیا۔ Categories کو محض گنا نہیں گیا: وزن sampled ملازمین کے اندازاً صرف کردہ وقت سے نکالا گیا، اس لیے 26٪ انسانی وقت کے proxy سے weighted اندرونی کام ہے۔ Quartz کی تشریح بھی واضح کرتی ہے کہ فروری میں measured lead صفر تھا، اگست میں 26٪ ہوا اور نتائج staff time کے مطابق weighted تھے۔
Frozen basket وقت کے ساتھ ایک جیسا تقابل دیتی ہے، لیکن اس کی حد بھی یہی ہے۔ score بڑھنے سے معلوم ہوتا ہے کہ جولائی کی baseline میں شامل کام زیادہ automate ہوا؛ صرف اس score سے یہ طے نہیں ہوتا کہ انسان نئے یا زیادہ مشکل کاموں کی طرف منتقل ہوئے یا نہیں۔ Anthropic نے basket کو وقفے وقفے سے دوبارہ بنانے اور نئے version کے تحت نتائج شائع کرنے کا منصوبہ بیان کیا ہے۔
Claude ہی محقق بھی، Claude ہی judge بھی
انڈیکس کی نمایاں methodological کمزوری یہ ہے کہ Claude کے کردار سے متعلق شواہد Claude agent نے جمع کیے اور دوسرے Claude instance نے فیصلہ دیا۔ ایک ہی model family میں مشترک غلطیاں یا ایک جیسے مفروضے ہو سکتے ہیں، اس لیے یہ آزاد audit نہیں ہے۔ Anthropic بھی cross-lab comparison کی دو رکاوٹیں مانتا ہے: مشترک methodology کا فقدان اور اپنے models سے اپنے نظام کا جائزہ لینا۔
کمپنی نے متعلقہ کام کے انسانی مالکان سے blind ratings لے کر judge کو جانچا۔ model اور انسان نے عین ایک درجہ 59٪ مواقع پر دیا، دو انسانوں کا exact agreement 35٪ تھا، جبکہ model اور انسانی درجہ 97٪ معاملات میں ایک level کے اندر رہا۔ یہ اعداد دکھاتے ہیں کہ پیمانہ مکمل طور پر بے ربط نہیں، مگر AL3 اور AL4 جیسے سرحدی فیصلوں میں حقیقی اختلاف موجود ہے۔
مزید یہ کہ index صرف Anthropic کے اندرونی AI R&D کو ناپتا ہے۔ دوسری labs کے نتائج اس وقت تک براہ راست قابلِ موازنہ نہیں ہوں گے جب تک task taxonomy، وقت کی weighting، شواہد اکٹھے کرنے کا طریقہ اور judging rules مشترک یا آزادانہ طور پر verify نہ ہوں۔
Recursive self-improvement ابھی ثابت نہیں
فروری کے صفر measured lead سے اگست کے 26٪ تک اضافہ چھ ماہ میں زیرِ نگرانی automation کی تیز پیش رفت دکھاتا ہے۔ مگر recursive self-improvement اس سے سخت دعویٰ ہے: model اپنے جانشین کی تحقیق، تعمیر، جانچ اور عملی نفاذ انسانی نگرانی کے بغیر سنبھالے۔ موجودہ index میں AL5 نہ ملنے کی وجہ سے یہ شرط پوری نہیں ہوئی۔
فی الحال مضبوط نتیجہ یہی ہے کہ Claude Anthropic کی ناپی گئی AI تحقیق و ترقی کے بیشتر حصے میں collaborator اور تقریباً ایک چوتھائی weighted کام میں supervised leader بن چکا ہے۔ اس تبدیلی کو مکمل خودمختاری کہنے کے لیے آئندہ AL5 شواہد، نئی version والی task basket، آزاد verification اور دوسری frontier labs کی قابلِ موازنہ پیمائشیں درکار ہوں گی؛ Anthropic کی موجودہ disclosure یہ نہیں بتاتی کہ وہ مرحلہ کب یا آیا کبھی حاصل ہوگا۔
یہ بھی پڑھیں:
متعلقہ مضامین


OpenAI کا AI اب research intern ہے، مگر فیصلے اب بھی انسان کے پاس

Claude کے حفاظتی بند توڑے گئے، نیت اور جائز تحقیق میں فرق اب بھی مشکل

Claude نے حد پار کی تو Anthropic نے تربیت روکی، اب آزاد جائزہ ہوگا

AI coding agents تیز ہیں، مگر productivity کا سیدھا جواب اب بھی نہیں

Claude کا EFS نگرانی کرے گا، مگر prompts Anthropic کے پاس نہیں جائیں گے
ہمارا نیوز لیٹر سبسکرائب کریں
ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔