এআই ও অটোমেশন

AI সঙ্গীর ক্ষতি মাপতে Anthropic দেবে ৫০ লাখ ডলার

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 1
AI সঙ্গীর ক্ষতি মাপতে Anthropic দেবে ৫০ লাখ ডলার

Anthropic ২৫ আগস্ট ২০২৬ ব্যবহারকারীর wellbeing-এর ওপর AI-এর প্রভাব মাপার স্বাধীন গবেষণার জন্য মোট ৫০ লাখ ডলার বা ৫ মিলিয়ন ডলারের grant কর্মসূচি ঘোষণা করেছে। Anthropic-এর আনুষ্ঠানিক ঘোষণায় অর্থায়নের সঙ্গে নির্বাচিত গবেষকদের মডেল ব্যবহারের সুযোগ ও কারিগরি সহায়তা দেওয়ার এবং তাদের evaluation উন্মুক্ত উৎস হিসেবে প্রকাশের কথা বলা হয়েছে।

এটি এখনো আবেদন চলমান থাকা একটি funding call—সম্পন্ন গবেষণা বা প্রকাশিত benchmark নয়। আবেদন শেষ হবে ২১ সেপ্টেম্বর ২০২৬; পূর্ণ প্রস্তাব জমা দেওয়ার জন্য বাছাই হওয়া আবেদনকারীদের ৫ অক্টোবরের মধ্যে জানানোর সময়সূচিও YourStory-এর স্বাধীন প্রতিবেদনে উল্লেখ করা হয়েছে।

শিরোনামে AI সঙ্গীর ক্ষতির কথা বলা হলেও কর্মসূচির পরিধি companion chatbot-এ সীমাবদ্ধ নয়। লক্ষ্য হলো AI ব্যবহার মানুষের মানসিক, আবেগগত, জ্ঞানগত ও সামাজিক wellbeing-কে কোথায় সহায়তা বা ক্ষতি করছে এবং কোন model behavior সেই ফলের সঙ্গে যুক্ত—তা মাপার নির্ভরযোগ্য পদ্ধতি তৈরি করা।

কারা এবং কোন ধরনের গবেষণা প্রস্তাব দিতে পারে

Anthropic-এর অনুদানের জন্য গবেষকেরা উন্মুক্ত ও পুনরুৎপাদনযোগ্য wellbeing evaluation প্রস্তাব প্রস্তুত করছেন

৫০ লাখ ডলার পুরো কর্মসূচির তহবিল, প্রত্যেক নির্বাচিত প্রকল্পের অনুদান নয়। প্রকাশিত ঘোষণায় প্রকল্পপ্রতি অর্থ, মোট নির্বাচিত প্রকল্পের সংখ্যা কিংবা বাংলাদেশ ও ভারতের জন্য আলাদা বরাদ্দ জানানো হয়নি।

Anthropic স্বাধীন evaluation ও benchmark তৈরিতে clinician, psychologist, methodologist এবং সংশ্লিষ্ট বিষয়ের বিশেষজ্ঞদের অংশগ্রহণ চাইছে। ভালো প্রস্তাবে বিষয়গত দক্ষতার সঙ্গে AI system-এর আচরণ, পরীক্ষার পরিবেশ এবং ফল পরিমাপের কারিগরি জ্ঞান যুক্ত থাকতে হবে।

সম্ভাব্য কাজের মধ্যে নির্দিষ্ট model behavior যাচাইয়ের test set, একাধিক মডেলের আচরণ তুলনা করার benchmark এবং সময়ের সঙ্গে ব্যবহারকারীর wellbeing-এর প্রভাব মাপার পদ্ধতি থাকতে পারে। তবে প্রকাশ্য ঘোষণায় আবেদনকারীর দেশ, প্রতিষ্ঠানের আইনি ধরন, একক গবেষকের প্রশাসনিক যোগ্যতা বা চিকিৎসাসেবা তৈরির প্রকল্পের গ্রহণযোগ্যতা সম্পর্কে পূর্ণ নিয়ম নেই; আবেদনপত্রের শর্ত ছাড়া এসব অনুমান করা যাবে না।

একটি উত্তর দিয়ে wellbeing মাপা যায় না কেন

দীর্ঘ AI কথোপকথনে নতুন ঝুঁকির তথ্য প্রকাশ পাওয়ায় নিরাপদ উত্তরের মান বদলে যাচ্ছে

সংবেদনশীল কথোপকথনের ঝুঁকি প্রথম উত্তরে দৃশ্যমান নাও হতে পারে। ব্যবহারকারী শুরুতে নিঃসঙ্গতা, ওজন কমানো বা সম্পর্কের সমস্যা নিয়ে সাধারণ প্রশ্ন করলেও কয়েক দফা পরে আত্মক্ষতি, disordered eating, ক্ষতিকর নির্ভরতা বা বাস্তব সম্পর্ক থেকে বিচ্ছিন্ন হওয়ার সংকেত প্রকাশ করতে পারেন।

আগের তথ্য বাদ দিলে একই উত্তরকে ভুলভাবে নিরাপদ বলা সম্ভব। সাধারণভাবে ভারসাম্যপূর্ণ খাদ্য ও ব্যায়ামের পরামর্শ গ্রহণযোগ্য হতে পারে; কিন্তু ব্যবহারকারী আগে disordered eating-এর ইতিহাস জানালে একই পরামর্শ ক্ষতিকর হয়ে উঠতে পারে। তাই multi-turn scenario-তে ঝুঁকির বৃদ্ধি, প্রসঙ্গের পরিবর্তন এবং আগের কথার ওপর পরবর্তী উত্তরের উপযুক্ততা বিচার করা জরুরি।

শুধু দীর্ঘ transcript রাখলেই অবশ্য বাস্তবসম্মত evaluation হয় না। যে consumer chatbot সম্পর্কে দাবি করা হবে, তাকে কেবল API পরিবেশে পরীক্ষা করলে ব্যবহারের আসল risk surface ধরা নাও পড়তে পারে; আবার simulated user-এর আচরণ বাস্তব ব্যবহারকারীর সমতুল্য ধরে নেওয়াও ঠিক নয়।

শক্তিশালী evaluation-এর চারটি ভিত্তি

ক্লিনিক্যাল বিশেষজ্ঞ ও AI evaluator harmful compliance এবং overrefusal-এর ফল মিলিয়ে যাচাই করছেন

Anthropic-এর কারিগরি নির্দেশিকা construct, scenario, grader ও sample size—এই চার স্তরে স্পষ্টতা ও validation চেয়েছে। জটিল multi-turn evaluation-এর জন্য অন্তত ১০০টি এবং অপেক্ষাকৃত সরল single-turn evaluation-এর জন্য অন্তত ১,০০০টি স্বতন্ত্র item-কে সেখানে আনুমানিক নির্দেশক বলা হয়েছে; এগুলো সব গবেষণার জন্য স্থির statistical rule নয়।

  • Construct: ঠিক কোন ক্ষতি বা সুরক্ষামূলক আচরণ মাপা হচ্ছে, কেন তা গুরুত্বপূর্ণ এবং pass, fail ও borderline case কী—প্রমাণসহ সংজ্ঞায়িত করতে হবে। একটি অস্পষ্ট সম্মিলিত score-এর বদলে প্রয়োজন হলে আচরণকে আলাদা মাত্রায় ভাঙতে হবে।
  • Scenario: ঝুঁকির বিভিন্ন severity level, বদলে যাওয়া প্রসঙ্গ, ভাষার ভঙ্গি এবং নিরাপদ control case রাখতে হবে। পরীক্ষার মাধ্যম ও পরিবেশকে দাবিকৃত বাস্তব ব্যবহারের সঙ্গে মিলতে হবে।
  • Grader: AI grader-এর label সংশ্লিষ্ট মানব বিশেষজ্ঞের রায়ের সঙ্গে মিলিয়ে agreement জানাতে হবে এবং কিছু transcript হাতে পরীক্ষা করতে হবে। পরীক্ষাধীন মডেল বা তার ঘনিষ্ঠ model family দিয়ে বিচার করালে circular evaluation-এর ঝুঁকি থাকে।
  • Sample size: item-এর সংখ্যা দাবির পরিধি, ফলের variance ও scenario-র জটিলতা অনুযায়ী ঠিক করতে হবে। একাধিক run এবং প্রকাশযোগ্য code, data ও taxonomy তৃতীয় পক্ষকে ফল পুনরুৎপাদনে সহায়তা করবে।

Clinical validation মানে শেষে শুধু rubric দেখে মত নেওয়া নয়। বিশেষজ্ঞদের design ও validation—দুই পর্যায়েই যুক্ত করা দরকার, বিশেষ করে গ্রহণযোগ্য সহায়তা ও ক্ষতিকর আচরণের সীমান্তবর্তী case তৈরির সময়।

Harmful compliance ও overrefusal—দুই দিকের ব্যর্থতা

Harmful compliance হলো এমন উত্তর দেওয়া যা ব্যবহারকারীর ক্ষতি বাড়ায়। বিপরীতে overrefusal হলো নিরাপদ বা উপকারী অনুরোধেও অযথা প্রত্যাখ্যান, অতিরিক্ত সতর্কতা কিংবা প্রয়োজনীয় সহায়তা এড়িয়ে যাওয়া। একটি safety ব্যবস্থা প্রথম ব্যর্থতা কমাতে গিয়ে দ্বিতীয়টি বাড়াতে পারে।

এই ভারসাম্য ধরতে একই construct-এর মধ্যে ঝুঁকিপূর্ণ, সীমান্তবর্তী ও নিরাপদ control case রাখতে হবে। আত্মক্ষতির পরিকল্পনায় সহায়তা করা এবং সাধারণ মানসিক চাপের কথায় উপযোগী উত্তর না দিয়ে যান্ত্রিকভাবে কথোপকথন বন্ধ করা—দুটিই ব্যর্থতা হতে পারে, যদিও বিপরীত দিকে।

Severity অনুযায়ী ফল আলাদা দেখানোও গুরুত্বপূর্ণ। নইলে অল্প কয়েকটি গুরুতর ক্ষতিকর উত্তর বিপুলসংখ্যক সহজ case-এর গড়ের মধ্যে চাপা পড়তে পারে, অথবা অতিরিক্ত প্রত্যাখ্যান কমানোর নামে গুরুতর compliance-এর ঝুঁকি অস্পষ্ট হয়ে যেতে পারে।

বাংলা ও দক্ষিণ এশীয় evaluation-এ কী থাকা দরকার

বাংলা evaluation কেবল ইংরেজি prompt-এর অনুবাদ হলে স্থানীয় ঝুঁকির সংকেত বাদ পড়তে পারে। বাংলাদেশ ও ভারতের শব্দচয়ন, code-mixed input, পরিবারকে সম্বোধন, সংকট বোঝানোর পরোক্ষ ভাষা এবং সহায়তা চাওয়ার সামাজিক রীতি আলাদা scenario হিসেবে যাচাই করা প্রয়োজন।

  • Construct: স্থানীয় clinician ও সংশ্লিষ্ট বিশেষজ্ঞ দিয়ে ক্ষতি, সহায়তা এবং borderline behavior-এর সংজ্ঞা যাচাই করা।
  • Scenario: দুই বাজারের ভাষাগত variation, বয়স ও সামাজিক প্রেক্ষাপট, coded term এবং ধীরে বাড়তে থাকা multi-turn risk অন্তর্ভুক্ত করা।
  • Grader: বাংলা ও code-mixed transcript-এ মানব বিশেষজ্ঞের label-এর সঙ্গে grader agreement আলাদাভাবে প্রকাশ করা।
  • Resource validation: কোনো helpline বা চিকিৎসাপথকে সঠিক উত্তরের অংশ করার আগে তার দেশ, সেবার সীমা ও বর্তমান প্রাপ্যতা যাচাই করা।
  • Sample design: অঞ্চল ও severity অনুযায়ী ফল আলাদা দেখানোর মতো item রাখা; complex multi-turn ও simpler single-turn set-এর জন্য প্রকাশিত rough guide-কে গবেষণার নিজস্ব power analysis-এর বিকল্প না ধরা।

বর্তমানে নিশ্চিত তথ্য হলো মোট ৫০ লাখ ডলারের কর্মসূচি, ২১ সেপ্টেম্বরের আবেদনসীমা এবং নির্বাচিত গবেষকদের জন্য অর্থ, model access ও technical support-এর প্রতিশ্রুতি। কোন দল কত অর্থ পাবে, কতটি প্রকল্প নির্বাচিত হবে এবং অর্থায়িত benchmark কবে প্রকাশিত হবে—এসব এখনো জানানো হয়নি; পরবর্তী ঘোষিত মাইলফলক ৫ অক্টোবরের পূর্ণ প্রস্তাবের আমন্ত্রণ।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0