Claude يقود 26% من أبحاث Anthropic، لكنه لا يعمل مستقلًا بالكامل

نشرت Anthropic في 17 سبتمبر 2026 ثلاثة مقاييس داخلية لتتبّع دور الذكاء الاصطناعي في تطوير النماذج. وتقول النتائج، التي تصف الوضع حتى أغسطس، إن Claude «يقود» 26% من أعمال البحث والتطوير لديها ويتعاون مع البشر في أكثر من 90% منها، فيما أكدت تغطية وكالة أسوشيتد برس أن النموذج ما زال خاضعًا للإشراف ولم يصل إلى العمل المستقل بالكامل.
لا تعني نسبة 26% أن Claude يختار وحده ما ينبغي بحثه أو يبني خليفته من البداية إلى النهاية بلا تدخل. المقصود أن النموذج يستطيع إنجاز معظم خطوات فئات محددة من العمل انطلاقًا من توجيه عام، بينما يبقى الإنسان مشرفًا؛ ولم تسجل الشركة أي فئة مقاسة عند مستوى الاستقلال الكامل.
«يقود» مستوى أتمتة وليس مرادفًا للاستقلال
يعتمد المؤشر سلّمًا من ست درجات، من AL0 الذي يعني عدم تدخل الذكاء الاصطناعي إلى AL5 الذي يعني التشغيل المستقل بلا إنسان داخل الحلقة. في AL3 «يتعاون» النظام مع الإنسان وينجز أجزاء كبيرة تحت توجيه قريب، أما AL4، وهو المستوى المقصود بكلمة «يقود»، فينجز فيه معظم المهمة من طرف إلى طرف انطلاقًا من طلب عالي المستوى مع استمرار الإشراف البشري.
الفارق بين AL4 وAL5 يتعلق بمن يبدأ العمل ومن يتحمل قرار المضي فيه، لا بطول المهمة وحده. يستطيع Claude عند مستوى القيادة التعامل مع خطوات التحقيق والتنفيذ والاختبار والمفاجآت التي تظهر أثناء العمل، لكن الإنسان يظل جزءًا لازمًا من العملية؛ أما الاستقلال الكامل فيفترض أن يرصد النظام الحاجة إلى المهمة ويحدد نطاقها وينفذها دون مشاركة بشرية إلزامية.
لذلك لا تقيس نسبة 26% مقدار الشيفرة التي كتبها Claude، ولا ساعات استخدامه، ولا نسبة موظفي Anthropic الذين استعانوا به. إنها حصة مرجّحة من سلة داخلية لفئات البحث والتطوير صُنفت عند مستوى AL4 أو أعلى، ولهذا لا يجوز تحويلها إلى ادعاء بأن ربع تطوير النموذج يجري بلا بشر.
كيف بنت Anthropic رقم 26%؟
توضح منهجية Anthropic المنشورة أنها أخذت عينة عشوائية من 20% من موظفي الأقسام الداخلة في دورة تطوير النماذج لكل أسبوع من يوليو 2026، واستخرج وكيل Claude من سجلات Slack والوثائق الداخلية نحو 15 ألف مهمة، ثم نظمها في شجرة من 542 عقدة بينها 378 فئة نهائية؛ وبعد ذلك بحث وكيل آخر كيفية تنفيذ كل فئة، ومنحها «حكم» مستقل من Claude درجة الأتمتة، قبل ترجيح النتائج وفق الوقت البشري المخصص للعمل.
هذه الطريقة أوسع من عدّ المخرجات، لكنها ليست قياسًا خارجيًا مباشرًا. نماذج من العائلة نفسها ساعدت في اكتشاف المهام وتنظيمها وجمع أدلتها والحكم على مستوى أتمتتها، ما يفتح احتمال أن يكرر نموذج التقييم بعض أخطاء النظام الذي يقيسه.
اختبرت الشركة هذا القيد بمقارنة أحكام النموذج مع تقييمات موظفين مسؤولين عن مجالات العمل. بلغ التطابق الدقيق بين النموذج والبشر 59%، وكانت التقديرات على مسافة مستوى واحد في 97% من الحالات؛ وهذه نتيجة تدعم استخدام المؤشر لرصد الاتجاه، لكنها تكشف أيضًا أن الحد بين «يتعاون» و«يقود» يتضمن حكمًا تقديريًا.
هناك قيد آخر في سلة العمل نفسها: فقد ثُبتت الفئات وأوزانها انطلاقًا من نشاط يوليو. ارتفاع المؤشر لاحقًا سيعني أن أنواع العمل الموجودة في تلك السلة أصبحت أكثر أتمتة، لكنه لا يثبت بمفرده أن إجمالي العمل البشري تراجع، لأن الباحثين قد ينتقلون إلى مهام جديدة أو مشكلات أصعب لا يلتقطها خط الأساس القديم.
مراقبة الوكلاء تكشف الحجم ولا تثبت الأمان
المقياس الثاني لا يسأل فقط كم تنجز الوكلاء، بل كم من أفعالها يمر عبر المراقبة، وكم تستغرق المراجعة، وما نسبة القرارات التي تُحجب أو تُصعّد. وبحسب تغطية رويترز للبيانات، كان نحو 30 ألف وكيل ينفذون أعمال البحث والهندسة في أي لحظة على المنصة الداخلية الرئيسية خلال أغسطس؛ ومرّت أفعالهم عبر فحص سابق للتنفيذ، فيما أظهر تحليل أكثر من مليار قرار حجب نحو قرار واحد من كل 47 ألفًا.
انخفاض معدل الحجب لا يثبت وحده أن الوكلاء آمنون. فالنتيجة تتأثر بسلوك الوكلاء، وقدرة المراقب على اكتشاف المخالفة، وتعريف الشركة لما يستوجب المنع، كما أن القياس يغطي منصتها الداخلية الأكثر استخدامًا لا كل تشغيل محتمل لـClaude.
تضيف Anthropic مراقبة لاحقة تبحث عن أنماط لا تظهر في قرار منفرد، ثم ترفع الحالات الأعلى أولوية إلى مراجعين بشريين. وجود هذه الطبقات مهم لفهم العنوان: اتساع العمل الذي تنفذه الوكلاء ترافق حتى الآن مع آليات إشراف وتدخل، لا مع تفويض كامل للبحث إلى نظام مستقل.
حصة الحوسبة لقطة أسبوعية لا ميزانية ثابتة
يتناول المقياس الثالث توزيع القدرة الحاسوبية. في عينة تمتد من 13 إلى 20 يوليو، قدرت الشركة أن نحو 6% من حوسبة البحث والتطوير ذهبت إلى أعمال السلامة، وأن الحصة بلغت نحو 12% داخل البحث والتطوير الذي تقوده أنظمة الذكاء الاصطناعي.
لكن هاتين النسبتين تصفان أسبوعًا واحدًا، ولا تكشفان اتجاهًا زمنيًا أو التزامًا ثابتًا بالإنفاق. كما أن التصنيف اعتمد على عينة مرجّحة من عمليات التدريب والتقييم وعلى وسوم وبيانات وصفية تشغيلية قد تكون غير مكتملة؛ وصُنّف العمل الذي يخدم السلامة والقدرات بالتساوي ضمن البحث والتطوير العام، ما يجعل النتيجة محافظة وفق تعريف Anthropic.
ولا تعادل حصة الحوسبة مقدار الاهتمام بالسلامة أو عدد الباحثين العاملين فيها. قد يحتاج بحث مهم إلى وقت بشري طويل وموارد حسابية محدودة، بينما تستهلك عملية تدريب واحدة قدرة كبيرة؛ لذلك تصبح المقارنة مفيدة فقط إذا تكررت بالطريقة نفسها وعُرفت حدود الفئات المستخدمة.
المقارنة بين المختبرات ما زالت غير ناضجة
يمكن لمختبرات أخرى نشر المقاييس العامة نفسها: مستوى أتمتة البحث، وتغطية مراقبة الوكلاء وسرعة التصعيد، وتوزيع الحوسبة. لكن مقارنة نسبة Anthropic بأي رقم تصدره شركة أخرى ستكون مضللة ما لم تتطابق سلة المهام وأوزانها وتعريفات مستويات الأتمتة وطريقة جمع الأدلة وتصنيفها.
المؤكد حاليًا هو أن Claude ينفذ معظم خطوات ربع سلة العمل المقاسة تقريبًا تحت إشراف بشري، لا أنه يطور خليفته مستقلًا. أما قابلية تدقيق البيانات من الخارج واستمرار الارتفاع في القياسات المقبلة فتبقيان سؤالين مفتوحين؛ وتقول Anthropic إنها تخطط لإتاحة عملياتها وبياناتها لمقيمين مستقلين ومواصلة نشر المؤشرات، وهو ما سيحدد إن كان الإفصاح الأول سيتحول إلى سلسلة قابلة للتحقق والمقارنة.
اقرأ أيضًا:
اشترك في نشرتنا الإخبارية
احصل على أحدث أخبار الويب 3 والذكاء الاصطناعي والعملات المشفرة مباشرة في بريدك.