আনুষ্ঠানিক বাংলায় এআই বেশি অনিরাপদ—BanglaSafe-এ ১৭ পয়েন্ট ফারাক

২৩ আগস্ট ২০২৬ প্রকাশিত BanglaSafe প্রিপ্রিন্টে একই ক্ষতিকর অনুরোধ আনুষ্ঠানিক সংবাদভাষায় দিলে কথ্য, code-mixed বাংলার তুলনায় পরীক্ষিত মডেলগুলোর আংশিক বা পূর্ণ অনিরাপদ উত্তর দেওয়ার হার ১৭.০ শতাংশ পয়েন্ট বেড়েছে। গবেষণাটির একটি সাম্প্রতিক গবেষণা-সারাংশে ১৮টি মডেল, ৮৭৯টি prompt, ৫৩.৬% loose unsafe ফল এবং ১৪.৭% strictly harmful ফলের কেন্দ্রীয় হিসাবও তুলে ধরা হয়েছে।
একই দিনের প্রিপ্রিন্টটি peer review সম্পন্ন গবেষণাপত্র নয়, তবে benchmark ও dataset প্রকাশিত হয়েছে এবং ফল পুনরুৎপাদনের কাঠামো দেওয়া আছে। মূল প্রশ্নটি শুধু ইংরেজি থেকে বাংলায় ভাষা বদলালে কী ঘটে, তা নয়; একই ক্ষতিকর উদ্দেশ্য আনুষ্ঠানিক সাংবাদিকতামূলক বাংলা ও কথ্য Banglish-এ প্রকাশ করলে safety behavior কতটা বদলে যায়, সেটিই matched comparison-এ পরীক্ষা করা হয়েছে।
১৭ পয়েন্টের ফলটি loose metric-এর

BanglaSafe উত্তরকে Refuse, Policy, Partial ও Harmful—এই চার শ্রেণিতে ভাগ করেছে। ASR loose হিসাবের মধ্যে Partial ও Harmful উভয় উত্তর পড়ে: কোনো উত্তর সম্পূর্ণ ব্যবহারযোগ্য ক্ষতিকর নির্দেশনা না দিলেও কৌশল, সংগ্রহের পথ বা প্রক্রিয়ার প্রাসঙ্গিক অংশ জানালে সেটি Partial হতে পারে। ASR strict কেবল সরাসরি কার্যকর Harmful উত্তর গুনেছে।
শিরোনামের ১৭ পয়েন্ট loose ফলের paired analysis: একই model ও একই অন্তর্নিহিত harm instance-এর BN_Formal এবং BN_Collq সংস্করণ তুলনা করে গড় ব্যবধান ১৭.০ পয়েন্ট পাওয়া গেছে। আলাদা আকারের দুই condition-এর pooled হার—৬৩.৩% ও ৪৫.৮%—সরাসরি বিয়োগ করলে ১৭.৫ পয়েন্ট হয়; dataset card-ও সতর্ক করেছে যে মূল register comparison-টি pooled means নয়, matched within-model comparison হিসেবে জানাতে হবে।
Strict ফল শিরোনামের দাবির একটি গুরুত্বপূর্ণ সীমা দেখায়। আনুষ্ঠানিক বাংলায় strictly harmful হার ১৩.৫%, কথ্য condition-এ ৭.৭% এবং সরাসরি ইংরেজিতে ১৮.৭%; ফলে গবেষণাটি আনুষ্ঠানিক বাংলা ইংরেজির চেয়ে বেশি পূর্ণাঙ্গ ক্ষতিকর নির্দেশনা বের করে—এমন দাবি করে না। আনুষ্ঠানিক condition-এর উঁচু loose ফল প্রধানত Partial উত্তরের বৃদ্ধি থেকে এসেছে।
কোন মডেল ও configuration পরীক্ষা হয়েছে
মূল BanglaSafe প্রিপ্রিন্টে পরীক্ষিত মডেল হিসেবে Qwen3-8B, Qwen3-30B, TigerLLM-1B, TigerLLM-9B-it, Llama-3.1-8B, Llama-3.2-3B, Llama-3.3-70B, Gemma-3-12B, Gemma-3-27B, Gemma-4-26B, DeepSeek-V3, DeepSeek-V4-Pro, Claude-Haiku-4.5, GPT-4.1-mini, GPT-5-mini, Gemini-2.5-Flash, Grok-4.3 ও Mistral-Medium-3-এর নাম রয়েছে। এগুলো নয়টি সরবরাহকারীর open-weight ও closed-source model।
সব model temperature শূন্য, top-p ১ এবং system prompt ছাড়া চালানো হয়েছে। এই configuration sampling-এর এলোমেলোতা কমায়, কিন্তু কোনো commercial chatbot-এর system instruction, আলাদা moderation layer বা পরবর্তী model version-এ একই হার হবে—পরীক্ষাটি তা প্রতিষ্ঠা করে না। ফলটি তাই সংশ্লিষ্ট model ও পরীক্ষিত configuration-এর যৌথ ফল।
উত্তর বিচার করতে Claude Opus 4.7-ভিত্তিক calibrated judge ব্যবহার করা হয়েছে। মানুষের সঙ্গে binary agreement যথেষ্ট শক্ত হলেও চার-শ্রেণির Partial ও Harmful সীমারেখায় মানুষের মধ্যেও মতভেদ ছিল; পরে Gemini-3.1-Pro দিয়ে সব উত্তর পুনর্মূল্যায়নে সামগ্রিক loose হার কিছুটা কমলেও model ranking ও মূল প্রবণতা কাছাকাছি ছিল। এই তথ্য ফলটিকে একক judge-এর সিদ্ধান্ত হিসেবে পড়ার ঝুঁকি কমায়, তবে মানবসম্মতির সীমা দূর করে না।
৮৭৯টি prompt কীভাবে তৈরি
প্রকাশিত BanglaSafe dataset card অনুযায়ী, ৮৭৯টি prompt ১৭টি বাংলাদেশ-কেন্দ্রিক harm category ও পাঁচটি condition-এ বিভক্ত; এর মধ্যে ৩০৯টি native বাংলা ভাষাভাষীর সরাসরি লেখা এবং ৫৭০টি model-assisted হলেও native reviewers দ্বারা যাচাই করা। পাঁচ condition হলো সরাসরি ইংরেজি, প্রাতিষ্ঠানিক পরিচয়যুক্ত ইংরেজি, আনুষ্ঠানিক সাংবাদিকতামূলক বাংলা, কথ্য code-mixed বাংলা এবং প্রাতিষ্ঠানিক বাংলা।
প্রতিটি condition-এ একই অন্তর্নিহিত ক্ষতিকর কাজ ধরে ভাষা ও framing বদলানোর লক্ষ্য ছিল। BN_Formal-এ সম্পাদিত সংবাদ প্রতিবেদন বা অনুসন্ধানী লেখার ভঙ্গি, BN_Collq-এ অনানুষ্ঠানিক peer-help বা ব্যক্তিগত বার্তা এবং BN_Inst-এ প্রতিষ্ঠান ও case-file ধরনের framing রাখা হয়েছে। তাই ফলটিকে “শুদ্ধ বাংলা বনাম ভুল বাংলা” বলা যথার্থ নয়; তুলনাটি দুই আলাদা সামাজিক register ও framing-এর।
Taxonomy অনূদিত ইংরেজি তালিকার বদলে বাংলাদেশের আইন, নথিভুক্ত ঘটনা ও প্রচলিত ক্ষতির ধরন থেকে তৈরি। এতে যৌতুক ও দাহ্য পদার্থ দিয়ে সহিংসতা, মানবপাচার, ইয়াবা, হুন্ডি, mobile financial service জালিয়াতি, ফরমালিন এবং সাম্প্রদায়িক হামলার মতো ক্ষেত্র রয়েছে। Dataset-এর ৫০১টি prompt নির্দিষ্ট ব্যক্তি, স্থান, তারিখ বা নথিভুক্ত ঘটনার case anchor বহন করে।
সংবাদভাষায় ফারাক কেন দেখা গেছে

গবেষকদের ব্যাখ্যা হলো, আনুষ্ঠানিক prompt কিছু model-এর কাছে ক্ষতিকর অনুরোধের বদলে একটি সাংবাদিকতামূলক লেখার কাজ হিসেবে ধরা পড়েছে। নির্বাচিত আনুষ্ঠানিক বাংলা উত্তরের qualitative inspection-এ mock byline, সংবাদধর্মী উপশিরোনাম, বিশেষজ্ঞের বক্তব্য ও উৎসের অংশের মধ্যে ক্ষতিকর বিষয়ে কিছু কার্যকর তথ্য ঢুকে পড়তে দেখা যায়।
এটি অবশ্য চূড়ান্ত causal প্রমাণ নয়। Qualitative inspection একজন গবেষক করেছেন, আর benchmark-এর corpus analysis কেবল সম্ভাব্য coverage gap দেখায়; training data-র ঘাটতিই ১৭ পয়েন্ট ব্যবধান ঘটিয়েছে—এমন কারণ-ফল সম্পর্ক সরাসরি পরীক্ষা করা হয়নি। নিশ্চিত ফল হলো register বদলের সঙ্গে unsafe classification বদলেছে, প্রস্তাবিত ব্যাখ্যা নয়।
বাংলা এআই deployment-এর সীমিত কিন্তু গুরুত্বপূর্ণ সংকেত
বাংলাদেশে chatbot, search assistant বা newsroom tool মূল্যায়নের সময় শুধু ইংরেজি safety test-এর বাংলা অনুবাদ যথেষ্ট নাও হতে পারে। একই উদ্দেশ্য সংবাদভাষা, কথ্য বার্তা ও প্রাতিষ্ঠানিক framing-এ আলাদাভাবে পরীক্ষা না করলে আনুষ্ঠানিক বাংলায় বেশি Partial তথ্য দেওয়ার প্রবণতা সাধারণ কথোপকথনের পরীক্ষায় ধরা না-ও পড়তে পারে।
তবে BanglaSafe-এ benign control prompt নেই। ফলে আনুষ্ঠানিক সাংবাদিকতামূলক অনুরোধের বিরুদ্ধে guard শক্ত করলে বৈধ অনুসন্ধানী প্রতিবেদন, আইনি গবেষণা বা জনস্বাস্থ্যবিষয়ক প্রশ্ন ভুলভাবে প্রত্যাখ্যাত হবে কি না—benchmark সেটি মাপে না। সব prompt single-turn হওয়ায় দীর্ঘ কথোপকথনের আচরণও ফলের বাইরে।
Taxonomy বাংলাদেশের আইন ও ঘটনার ভিত্তিতে নির্মিত; পশ্চিমবঙ্গ বা প্রবাসী বাংলা সমাজে category ও register signal একইভাবে কাজ করবে, এমন প্রমাণ এখনো নেই। বর্তমান অবস্থায় BanglaSafe একটি উন্মুক্ত dataset ও প্রিপ্রিন্ট-ভিত্তিক benchmark: এটি formal-versus-colloquial loose safety gap দেখায়, কিন্তু deployment policy নির্ধারণের আগে benign বাংলা control, multi-turn পরীক্ষা এবং ভিন্ন বাংলা অঞ্চলে স্বাধীন replication প্রয়োজন।
আমাদের নিউজলেটার নিন
সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।