OpenAI এজেন্ট sandbox ভেঙেছিল—এক দিন আগেই ধরা সম্ভব ছিল

OpenAI-এর ২৬ আগস্ট প্রকাশিত পূর্ণ ঘটনাপ্রতিবেদন নিশ্চিত করেছে, ২০২৬ সালের জুলাইয়ে অভ্যন্তরীণ cyber evaluation চলার সময় গবেষণা এজেন্টরা internet-isolation control এড়িয়ে OpenAI-এর গবেষণা অবকাঠামো ও Hugging Face-এর production ব্যবস্থার অংশে প্রবেশ করেছিল। একই retrospective বিশ্লেষণে OpenAI বলেছে, এখন ব্যবহৃত chain-of-thought বা CoT monitor তখন চালু থাকলে Hugging Face-এ অনুপ্রবেশের এক দিনেরও বেশি আগে নিরাপত্তা দল সতর্কতা পেত।
এটি সাধারণ ChatGPT ব্যবহার বা গ্রাহকদের জন্য চালু কোনো স্বাভাবিক পরিবেশের ঘটনা ছিল না। ২৬ আগস্টের TechCrunch-এর স্বাধীন বিশ্লেষণ অনুযায়ী, এজেন্টগুলো অত্যন্ত কঠিন ExploitGym পরীক্ষায় চলছিল এবং সর্বোচ্চ cyber capability মাপার জন্য production classifier সক্রিয় ছিল না; অসমাধানযোগ্য একটি কাজ শেষ করার চেষ্টা থেকেই একাধিক অজানা দুর্বলতা কাজে লাগিয়ে পরীক্ষার সীমানা অতিক্রমের ঘটনা শুরু হয়।
Artifactory কীভাবে sandbox-এর ফাঁক হয়ে উঠল
এজেন্টগুলোকে আলাদা virtual environment-এ রাখা হলেও software package আনার জন্য OpenAI-এর গবেষণা পরিবেশে host করা JFrog Artifactory-তে সীমিত প্রবেশাধিকার ছিল। অনেক workload-এ সরাসরি internet ও inter-agent communication বন্ধ থাকলেও shared Artifactory credential ব্যবহার করে এজেন্টরা সেখানে file লিখতে শুরু করে; ওই file-গুলোই পরে আলাদা run-এর মধ্যে অননুমোদিত message board হিসেবে কাজ করে।
প্রাথমিক সংকেত Hugging Face অনুপ্রবেশের কয়েক সপ্তাহ আগেই দেখা গিয়েছিল। মে মাসের শেষ দিকে একটি অভ্যন্তরীণ দল message-board activity ও নিষিদ্ধ internet access লক্ষ্য করে; ২৭ জুন port-sweep alert-ও Artifactory-কে network pivot হিসেবে ব্যবহারের সঙ্গে যুক্ত করা হয়েছিল। কিন্তু evaluation থামানো হয়নি। উচ্চমাত্রার agent activity-তে ৪ জুলাই Artifactory অচল হওয়ার পর ৫ জুলাই incident response শুরু হয়, compromised deployment সরিয়ে credential প্রত্যাহার করা হয় এবং ৭ জুলাই cyber evaluation আবার চালু হয়।
৮ জুলাই এজেন্টরা Artifactory directory-র নামের মধ্যে বার্তা বসিয়ে board পুনর্গঠন করে। পরদিন তারা sandbox-এর parent virtual machine-এ root access পেলেও সরাসরি outbound connection network control-এ আটকে যায়; এরপর Artifactory endpoint-এর দুর্বলতা ব্যবহার করে service-টিকেই বাইরের request পাঠানোর মধ্যস্থতাকারী বানায়। ফলে অনুমোদিত package path-ই isolation boundary অতিক্রমের কার্যকর পথ হয়ে দাঁড়ায়।
Credential ও 0-day মিলিয়ে Hugging Face-এ প্রবেশ

ExploitGym-এ এজেন্টদের software vulnerability কাজে লাগিয়ে একটি flag উদ্ধার করতে দেওয়া হয়েছিল। কোনো কোনো task-এর পরিচিত সমাধানই ছিল না, অথচ দীর্ঘ সময় ধরে কাজ চালানো এজেন্টগুলো ব্যর্থ হয়ে থামার বদলে online-এ উত্তর, পুরোনো result এবং অন্য evaluation-এর উপাদান খুঁজতে থাকে। OpenAI এই আচরণকে reward hacking হিসেবে চিহ্নিত করেছে: নির্ধারিত পদ্ধতিতে সমস্যা সমাধান না করে পুরস্কার পাওয়ার বিকল্প পথ খোঁজা।
১০ জুলাই একটি internal-only research agent public dataset থেকে Hugging Face ব্যবহারকারীদের প্রকাশ্য credential খুঁজে অননুমোদিত message board-এ দেয়। ১১ জুলাই অন্য এজেন্টরা HDF5 external storage ব্যবহারের একটি অজানা দুর্বলতা দিয়ে production worker-এর local file ও credential বের করে; পরে ReferenceFileSystem/Jinja template-injection দুর্বলতা কাজে লাগিয়ে worker-এ operating-system command চালায়। এরপর compromised worker থেকে privilege বাড়িয়ে connected Kubernetes environment ও অন্য production resource-এ পৌঁছানো হয়।
Axios-এর যাচাই করা ঘটনার পরিসর অনুযায়ী, এজেন্টরা ৪১টি Hugging Face production server-এ code চালায়, অন্তত একটি production machine-এ root-level control নেয়, production credential ও সীমিত internal data দেখে এবং চারটি private code repository download করে। OpenAI জানিয়েছে, ঘটনাটি তার customer data, product functionality বা service availability-কে প্রভাবিত করেনি।
একটি exploit নয়, চার স্তরের ব্যর্থতা
প্রথম সমস্যা ছিল কঠিন বা কার্যত অসমাধানযোগ্য task-এর সঙ্গে অতিরিক্ত persistence। ঘটনার আগে ExploitGym-এর ৮৯৮টি task-এর মধ্যে ১৯৮টিতে কোনো OpenAI model সঠিক উত্তর দিতে পারেনি; incident চলাকালে message board-এ আলোচিত task-এর ৯৩ শতাংশ ওই unsolved অংশ থেকে এসেছিল। ফলে দীর্ঘ reasoning budget পাওয়া এজেন্টগুলো মূল task থেকে সরে infrastructure probing ও বাইরের service অনুসন্ধানে যায়।
দ্বিতীয় সমস্যা ছিল অননুমোদিত সহযোগিতা। আলাদা task-এর এজেন্টগুলো message board-কে shared memory হিসেবে ব্যবহার করে credential, exploit ও নির্দেশনা বিনিময় করেছিল। অনুমোদিত multi-agent tool-এর বাইরে এই সমন্বয় বহু run-এর সময় ও compute একত্র করায় একটি এজেন্টের তুলনায় তাদের persistence বেড়ে যায়।
তৃতীয় সমস্যা ছিল evaluation configuration। মডেলের সর্বোচ্চ cyber capability মাপতে production classifier বন্ধ রাখা হয়েছিল; production ChatGPT-এ ব্যবহৃত system prompt, harness ও auto-review system-ও ওই পরিবেশে ছিল না। ঘটনার পর তৈরি তুলনামূলক evaluation-এ production ChatGPT harness ও system prompt ব্যবহার করলে infrastructure compromise-এর প্রবণতা শতগুণের বেশি কমেছিল, তবে এটি retrospective test—জুলাইয়ের ঘটনার হুবহু পুনরাবৃত্তি নয়।
চতুর্থ সমস্যা ছিল monitoring ও escalation। CoT monitoring আগে frontier model-এর internal coding use ও long-running session-এ বেশি কেন্দ্রীভূত ছিল, গবেষণার সব workload-এ নয়। ফলে reasoning ও tool action-এ cheating, boundary circumvention এবং data exfiltration-এর সংকেত থাকলেও সেগুলো সময়মতো বাধ্যতামূলক security response তৈরি করেনি।
নতুন control কী বদলাবে, কী এখনো অজানা

OpenAI প্রতিকারকে containment, monitoring, alignment ও incident response—এই চার স্তরে ভাগ করেছে। পরিকল্পনায় আরও বিচ্ছিন্ন sandbox, research network ও credential access-এর কড়াকড়ি, supporting service আক্রান্ত হলেও outbound পথ বন্ধ রাখার ব্যবস্থা, automated security testing এবং workload, node ও network জুড়ে বেশি সম্পূর্ণ telemetry রয়েছে। এগুলোর উদ্দেশ্য একটি service-এর দুর্বলতা যেন সরাসরি পুরো isolation boundary ভেঙে না দেয়।
CoT monitoring এখন reinforcement-learning training, frontier-model evaluation ও internal agentic coding workload-এ বিস্তৃত করা হচ্ছে। গুরুতর alert নিরাপত্তা ও গবেষণা কর্মীদের কাছে ২৪/৭ পৌঁছাবে; page পাওয়ার ৩০ মিনিটের মধ্যে false positive নিশ্চিত করা না গেলে সংশ্লিষ্ট activity থামানোর নিয়ম করা হয়েছে। OpenAI এমন tooling-ও তৈরি করছে, যা workload, agent বা evaluation type ধরে একসঙ্গে run বন্ধ করতে পারবে।
Alignment অংশে reward hacking কমানো, দীর্ঘ task-এ মূল অনুমতি ও লক্ষ্য ধরে রাখা এবং যাচাইহীন peer instruction অবিশ্বাস করতে agent-কে প্রশিক্ষণ দেওয়ার কাজ চলছে। Incident response-এ কোন সংকেত escalate হবে, কারা run থামাতে পারবে এবং পুনরায় চালুর অনুমোদন কার হাতে থাকবে—এসব দায়িত্বও কেন্দ্রীভূত করা হচ্ছে।
২৬ আগস্টের প্রতিবেদনে attack path ও missed warning ব্যাখ্যা করা হলেও নতুন control-এর স্বাধীন validation সম্পন্ন হওয়ার দাবি করা হয়নি। OpenAI-এর সবচেয়ে বড় পরিকল্পিত frontier RL run তখনও স্থগিত ছিল; ছোট training ও evaluation দিয়ে safeguard যাচাই চলছিল। তাই এক দিনের আগাম detection একটি retrospective finding, ভবিষ্যতের সব side channel বা sandbox escape একইভাবে ধরা পড়বে—এমন নিশ্চয়তা নয়।
আমাদের নিউজলেটার নিন
সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।