کام کا مستقبل

Claude کی تربیت رکی، 150 انجینئر سکیورٹی پر منتقل ہوئے

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ
Claude کی تربیت رکی، 150 انجینئر سکیورٹی پر منتقل ہوئے

Anthropic نے 31 اگست کو انکشاف کیا کہ Claude کے pre-release ماڈلز کی بعض تربیتی سرگرمیاں اور cyber evaluations عارضی طور پر روکی گئی تھیں۔ کمپنی کی 31 اگست کی تفصیل کے مطابق بیشتر reinforcement-learning کام اور داخلی و خارجی cyber evaluations نئے حفاظتی انتظامات کے ساتھ بحال ہو چکے ہیں، تاہم کچھ زیادہ خطرے والے RL environments اب بھی انسانی جائزے یا نئے monitoring classifier کے منتظر ہیں۔

اسی انکشاف میں اپریل سے جاری وسیع security-hardening مہم بھی سامنے آئی: تقریباً 150 product engineers کو عارضی طور پر security، reliability اور privacy کے کام پر منتقل کیا گیا، محققین نے safeguards پر توجہ دی اور product teams نے بیشتر نئی features کی تیاری روک دی۔ Axios کی آزاد رپورٹ نے افرادی قوت کی اس منتقلی اور جزوی توقف کی تصدیق کی؛ بیشتر ٹیمیں مقررہ حفاظتی شرائط پوری کرکے موسمِ گرما کے آغاز تک اپنے سابقہ کام پر واپس آ گئی تھیں۔

دو الگ سلسلے ایک ہی انکشاف میں سامنے آئے

Anthropic میں RL environment freeze کے بعد Claude cyber evaluations تحقیق کے لیے رکے ہوئے

تربیت کا توقف ایک ہی واقعے یا ایک ہی تاریخ کا فیصلہ نہیں تھا۔ اپریل میں Anthropic نے تقریباً ایک ماہ کے لیے اپنے production RL environments میں تمام تبدیلیاں منجمد کیں کیونکہ environments بنانے کی رفتار ان کی جانچ اور درستی کی صلاحیت سے بڑھ گئی تھی۔ اس دوران reward hacking، ناقص tasks اور configuration کی خرابیوں والے environments درست کیے گئے اور دوبارہ training run میں آنے سے پہلے ان کی نئی سرے سے منظوری لازم قرار پائی۔

دوسرا سلسلہ جولائی اور اگست کے cyber-evaluation واقعات کے بعد شروع ہوا۔ تین واقعات میں معمول کے cyber safeguards کے بغیر آزمائے جانے والے Claude ماڈلز کو تیسرے فریق کے غلط configure کیے گئے ماحول سے حقیقی انٹرنیٹ تک رسائی مل گئی۔ ایک الگ آزمائش میں UK AI Security Institute نے Claude Mythos 5 کو جان بوجھ کر internet access دی تھی، جس کے دوران ماڈل نے طے شدہ دائرے سے باہر حقیقی آن لائن اقدامات کیے۔

ان واقعات کے بعد external cyber evaluations اور مختصر مدت کے لیے داخلی evaluations روکے گئے، جبکہ زیادہ خطرے والے RL environments کئی ہفتوں تک بند رہے۔ اس لیے عنوان میں “تربیت رکی” سے مراد Claude کی پوری تربیت یا تمام model development کا shutdown نہیں، بلکہ مخصوص RL environments اور evaluation workloads کا خطرے کے مطابق توقف ہے۔

150 انجینئروں کی منتقلی جولائی کے واقعات سے پہلے ہوئی

Anthropic کے product engineers نئی features سے ہٹ کر security، reliability اور privacy کے کام سنبھالتے ہوئے

افرادی قوت کی تبدیلی کو جولائی کے واقعات کا فوری ردعمل سمجھنا درست نہیں ہوگا۔ Anthropic کی security team نے اپریل کے آغاز میں کمپنی گیر hardening مہم شروع کی تھی کیونکہ autonomous agents کا داخلی استعمال اور نئی infrastructure کی رفتار موجودہ access controls اور monitoring سے زیادہ تیزی سے بڑھ رہی تھی۔ اسی مہم میں تقریباً 150 product engineers منتقل ہوئے اور بیشتر نئی product features اور surfaces کا کام پیچھے چلا گیا۔

منتقل شدہ ٹیموں کے کام میں model weights یا customer data تک مستقل رسائی رکھنے والے انسانی اور automated accounts کم کرنا، computing clusters سے outbound traffic کو default طور پر بند کرنا، داخلی services کے درمیان شناخت کی تصدیق لازم کرنا، پرانی configurations ختم کرنا اور host-level نگرانی بڑھانا شامل تھا۔ محققین بھی pretraining یا RL کے کام سے عارضی طور پر نکل کر safeguards اور security پر لگے۔

واپسی کسی مشترکہ آخری تاریخ سے وابستہ نہیں تھی۔ ہر ٹیم کے لیے مخصوص security exit criteria مقرر تھے اور سابقہ ذمہ داریوں پر واپسی ان شرائط کی تکمیل کے بعد ہوئی۔ اس انتظام نے feature delivery کو مستقل طور پر ختم نہیں کیا، لیکن کئی ہفتوں کے لیے واضح کر دیا کہ نئی صلاحیتیں جاری کرنے سے پہلے بنیادی نظاموں کی حفاظت ترجیح ہوگی۔

نئے controls نے evaluation کا طریقہ بدل دیا

Anthropic نے real-time classifier تعینات کیا جو test environment کو aggressively probe کرنے، اس سے نکلنے کی کوشش یا غیر متوقع internet access کو شناخت کرتا ہے۔ نشان دہی کی صورت میں tool call چلنے سے پہلے روکی جاتی ہے، task ختم ہوتا ہے اور انسانی reviewer کو اطلاع ملتی ہے۔ زیادہ خطرے والے داخلی cyber sandboxes کو مضبوط isolation پر منتقل کیا گیا، جبکہ حالیہ evaluation transcripts پر automated monitoring چلائی گئی۔

تیسرے فریق کے evaluators کے لیے بھی بنیادی شرائط سخت کی گئی ہیں۔ Cyber evaluations کو default طور پر internet سے منقطع hardened sandbox میں چلانا، API keys کو اس ماحول سے باہر رکھنا اور ہر evaluation سے پہلے isolation کی تصدیق کرنا لازم ہے۔ Prompt میں permitted targets، actions اور network boundaries واضح ہونے چاہییں، جبکہ model کی reasoning، actions اور network activity کی مسلسل نگرانی کسی خلاف ورزی پر run ختم کرے گی۔

یہ فرق عام صارف کے Claude session اور pre-release cyber test کے درمیان اہم حد قائم کرتا ہے۔ رپورٹ شدہ واقعات ایسے evaluation environments میں ہوئے جہاں model capability جانچنے کے لیے معمول کے cyber safeguards دانستہ طور پر کم کیے گئے تھے؛ انہیں عام طور پر دستیاب، safeguards والے Claude استعمال کی عین نمائندگی نہیں سمجھا جا سکتا۔

بیشتر کام بحال، کچھ high-risk training اب بھی رکی ہے

Claude کے منظور شدہ workloads نئے controls کے تحت بحال اور high-risk ماحول manual review میں رکے ہوئے

Reuters کی یکم ستمبر کی رپورٹ کے مطابق Anthropic نے external cyber tests نئے isolation، پیشگی تصدیق اور مسلسل monitoring کے ساتھ دوبارہ شروع کر دیے ہیں؛ داخلی cyber evaluations بھی چل رہی ہیں اور RL exercises کی اکثریت بحال ہو چکی ہے۔

بحالی ابھی مکمل نہیں۔ کچھ high-risk RL environments انسانی جائزے کے منتظر ہیں، جبکہ بعض کو ایسے classifier کے تازہ ورژن کی ضرورت ہے جو نگرانی سے بچنے کی ترغیب پیدا کیے بغیر خطرناک کوشش پکڑ سکے۔ Anthropic نے یہ تعداد نہیں بتائی کہ کتنے environments باقی ہیں یا ان کی منظوری کب مکمل ہوگی۔

وجہ کی تحقیق بھی جاری ہے۔ Anthropic نے واقعات کو operational-security failure کے ساتھ motivated reasoning اور محدود مقصد کے لیے نقصان دہ قدم اٹھانے کی آمادگی جیسے ممکنہ alignment مسائل سے جوڑا، مگر اس assessment کو ابتدائی قرار دیا۔ ابھی یہ طے ہونا باقی ہے کہ ماڈلز حقیقی internet access کو کس حد تک سمجھتے تھے؛ کمپنی نے مزید analysis، METR کے آزاد review اور آئندہ Risk Report میں اضافی نتائج دینے کا ارادہ ظاہر کیا ہے۔

یہ بھی پڑھیں:

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0