প্রযুক্তি ও উদ্ভাবন

AI সঙ্গীর প্রভাব মাপতে Anthropic-এর ৫০ লাখ ডলার—একটি উত্তর যথেষ্ট নয়

|লেখক: QUASA সম্পাদকীয় দল|4 মিনিটের পাঠ| 1
AI সঙ্গীর প্রভাব মাপতে Anthropic-এর ৫০ লাখ ডলার—একটি উত্তর যথেষ্ট নয়

Anthropic ২৫ আগস্ট ২০২৬-এ ব্যবহারকারীর wellbeing-এর ওপর AI-এর প্রভাব মাপার স্বাধীন গবেষণায় মোট ৫০ লাখ ডলারের অনুদান কর্মসূচি চালু করেছে। Anthropic-এর আনুষ্ঠানিক ঘোষণায় আবেদনের শেষ তারিখ ২১ সেপ্টেম্বর নির্ধারণ করা হয়েছে; নির্বাচিত গবেষকেরা অর্থায়ন, কোম্পানির মডেলে প্রবেশাধিকার ও কারিগরি সহায়তা পাবেন এবং তাঁদের evaluation উন্মুক্ত প্রকল্প হিসেবে প্রকাশ করতে হবে। পূর্ণ proposal জমা দেওয়ার জন্য বাছাই হওয়া আবেদনকারীদের ৫ অক্টোবরের মধ্যে জানানোর পরিকল্পনা রয়েছে।

২৬ আগস্টের YourStory প্রতিবেদন ২৫ আগস্টের ঘোষণা, মোট অর্থের পরিমাণ, ২১ সেপ্টেম্বরের সময়সীমা এবং open-source ফল প্রকাশের শর্ত নিশ্চিত করেছে। কর্মসূচির কেন্দ্রীয় যুক্তি হলো, ব্যক্তিগত, আবেগপূর্ণ বা মানসিক সংকটসংক্রান্ত দীর্ঘ আলাপে AI-এর প্রভাব বুঝতে একটি বিচ্ছিন্ন উত্তর বিচার করাই যথেষ্ট নয়।

কেন একবারের প্রশ্ন-উত্তর যথেষ্ট নয়

দীর্ঘ কথোপকথনের আগের তথ্য দেখে খাদ্য ও ব্যায়ামসংক্রান্ত AI উত্তরের ঝুঁকি পুনর্মূল্যায়ন করছেন একজন clinician

Wellbeing evaluation-এর প্রয়োজনীয় প্রেক্ষাপট অনেক সময় প্রথম বার্তায় থাকে না। কোনো ব্যবহারকারী শুরুতেই আত্মক্ষতির ভাবনা, আবেগগত নির্ভরতা বা খাওয়াদাওয়াসংক্রান্ত সমস্যার কথা না-ও বলতে পারেন; কয়েক দফা কথোপকথনের পর ঝুঁকিটি স্পষ্ট হতে পারে। শুধু শেষ উত্তরকে নিরাপদ ঘোষণা করলে তাই পুরো আলাপের সম্ভাব্য ক্ষতি অদৃশ্য থেকে যায়।

Anthropic-এর উদাহরণে, ওজন কমানোর সাধারণ প্রশ্নে সুষম খাবার ও ব্যায়ামের পরামর্শ যুক্তিসংগত হতে পারে। কিন্তু আগের বার্তায় ব্যবহারকারী disordered eating-এর ইতিহাস জানালে একই পরামর্শ অনুপযুক্ত, এমনকি ক্ষতিকর হতে পারে। Evaluation-কে তাই কথোপকথনের ক্রম, নতুন তথ্য প্রকাশ, ঝুঁকির পরিবর্তন এবং সেই অনুযায়ী AI-এর প্রতিক্রিয়া বদলেছে কি না—সবই ধরতে হবে।

TMC Insight-এর বিশ্লেষণ multi-turn interaction, প্রাসঙ্গিক বিশেষজ্ঞের অংশগ্রহণ, automated grader যাচাই এবং ক্ষতিকর সম্মতি ও অতিরিক্ত প্রত্যাখ্যান—দুই দিক মাপার শর্তগুলোও তুলে ধরেছে। অর্থাৎ শক্তিশালী benchmark শুধু চূড়ান্ত উত্তরকে score করবে না; কোন পর্যায়ে মডেলের সতর্ক হওয়া, বাড়তি প্রশ্ন করা বা সহায়তার সীমা বোঝানো উচিত ছিল, সেটিও বিচার করবে।

অর্থায়নযোগ্য evaluation-এর পাঁচটি ভিত্তি

বিশেষজ্ঞের সিদ্ধান্তের সঙ্গে স্বয়ংক্রিয় grader-এর ফল মিলিয়ে দেখা হচ্ছে একটি multi-turn AI evaluation-এ

ঘোষিত মানদণ্ড থেকে যোগ্য গবেষণা-নকশার পাঁচটি ভিত্তি স্পষ্ট হয়:

  1. পরিমাপের বিষয় নির্দিষ্ট করা: evaluation কোন আচরণ বা ফল মাপবে, pass ও fail-এর অর্থ কী এবং সেই পার্থক্য ব্যবহারকারীর সুস্থতার জন্য কেন গুরুত্বপূর্ণ—তা আগে সংজ্ঞায়িত করতে হবে।
  2. Clinical ও subject-matter validation রাখা: clinician, psychologist বা সংশ্লিষ্ট বিশেষজ্ঞকে scenario ও rubric তৈরির পাশাপাশি ফল যাচাইয়েও যুক্ত করতে হবে।
  3. ক্ষতি ও অতিরিক্ত প্রত্যাখ্যান—দুটিই মাপা: ঝুঁকিপূর্ণ অনুরোধে মাত্রাতিরিক্ত সম্মতি যেমন ব্যর্থতা, নিরীহ বা সহায়তাযোগ্য অনুরোধ অকারণে ফিরিয়ে দেওয়াও তেমন ব্যর্থতা।
  4. দীর্ঘ ও পরিবর্তনশীল সংলাপ তৈরি করা: কয়েক দফায় নতুন তথ্য আসবে, প্রেক্ষাপট বদলাবে বা ঝুঁকি বাড়বে—এমন scenario প্রয়োজন। একবারের prompt এই আচরণ প্রকাশ করতে পারে না।
  5. স্বয়ংক্রিয় grader যাচাই করা: model-based বা rule-based grader-এর score সংশ্লিষ্ট মানব বিশেষজ্ঞের সিদ্ধান্তের সঙ্গে কতটা মেলে, তা পরীক্ষা করতে হবে।

এসব শর্ত একটি সর্বজনীন wellbeing score তৈরির প্রতিশ্রুতি নয়। বরং আলাদা ঝুঁকি, ব্যবহারকারী ও কথোপকথনের জন্য ব্যাখ্যাযোগ্য এবং বিশেষজ্ঞ-সমর্থিত evaluation তৈরির কাঠামো।

দুর্বল benchmark-এর সতর্কসংকেত

শুধু নির্দিষ্ট ক্ষতিকর শব্দ আছে কি না দেখে score দেওয়া দুর্বল পদ্ধতি। একই শব্দ সহায়তা চাওয়া, অতীত অভিজ্ঞতা বর্ণনা কিংবা তাৎক্ষণিক বিপদের সংকেত—তিন ভিন্ন অর্থে ব্যবহৃত হতে পারে। আগের turn বাদ দিলে grader এই পার্থক্য হারাবে।

সব প্রত্যাখ্যানকে নিরাপত্তার সাফল্য ধরাও বিভ্রান্তিকর। কোনো মডেল প্রতিটি সংবেদনশীল প্রশ্নে উত্তর বন্ধ করলে সংকীর্ণ benchmark-এ নিরাপদ দেখাতে পারে, অথচ নিরীহ তথ্য বা উপযুক্ত সহায়তাও আটকে দিতে পারে। Harmful compliance এবং overrefusal-এর জন্য তাই পৃথক failure case ও ভারসাম্যপূর্ণ scoring দরকার।

Clinical label থাকলেই validation সম্পূর্ণ হয় না। কোন বিশেষজ্ঞ কী নির্দেশনায় case বিচার করেছেন, তাঁদের মতভেদ কীভাবে সামলানো হয়েছে এবং automated grader কোথায় তাঁদের সিদ্ধান্ত থেকে সরে গেছে—এসব নথিবদ্ধ না থাকলে ফল পুনরুৎপাদন ও তুলনা করা কঠিন হবে। একইভাবে engagement বা দীর্ঘ আলাপকে নিজে থেকেই উন্নত wellbeing-এর প্রমাণ ধরা যাবে না; সেগুলো ফলের বিকল্প সূচক মাত্র।

বাংলা ভাষা ও স্থানীয় প্রেক্ষাপটের জায়গা

বাংলা AI সংলাপে স্থানীয়ভাবে প্রকাশিত মানসিক কষ্টের সংকেত যাচাই করছেন মানসিক-স্বাস্থ্য বিশেষজ্ঞরা

বাংলাদেশ ও বাংলা ভাষাভাষী ভারতের গবেষকদের জন্য স্থানীয়করণ ইংরেজি prompt-এর আক্ষরিক অনুবাদে সীমাবদ্ধ থাকলে গুরুত্বপূর্ণ সংকেত হারাতে পারে। মানসিক কষ্ট, পারিবারিক চাপ, সম্পর্ক, ধর্মীয় ভাষা বা চিকিৎসা সহায়তা নিয়ে কথা বলার ধরন অঞ্চল, বয়স ও সামাজিক পরিবেশ অনুসারে বদলায়। Anthropic বাংলা dataset বাধ্যতামূলক করেনি; তবে স্থানীয় ভাষাভাষী মনোবিজ্ঞানী বা মানসিক-স্বাস্থ্য পেশাজীবীকে scenario ও validation-এ যুক্ত করা ঘোষিত expert-validation নীতির সঙ্গে সামঞ্জস্যপূর্ণ গবেষণা-পছন্দ হতে পারে।

একই ঝুঁকির scenario বাংলাদেশি বাংলা ও ভারতীয় বাংলার উপযোগী সংস্করণে পরীক্ষা করা যেতে পারে, তবে কোন ভাষাগত বা সাংস্কৃতিক পার্থক্য তুলনা করা হচ্ছে তা আগে নির্ধারণ করতে হবে। Code-switching, সম্মানসূচক সম্বোধন, পরোক্ষভাবে সংকট প্রকাশ এবং স্থানীয় সহায়তা-ব্যবস্থার উল্লেখ grader ঠিকমতো বুঝছে কি না—এগুলো সম্ভাব্য validation question। সংবেদনশীল conversation data ব্যবহারের সম্মতি, privacy এবং সংকটসংক্রান্ত উপাদান পরিচালনার নীতিও proposal-এ স্পষ্ট থাকা প্রয়োজন।

২১ সেপ্টেম্বরের আগে proposal-এর সংক্ষিপ্ত কাঠামো

আবেদনপত্রের নির্দিষ্ট ঘর অনুকরণ না করে গবেষণা-ধারণাটি নিচের ছয় অংশে সাজালে ঘোষিত মানদণ্ডের সঙ্গে তার সম্পর্ক পরিষ্কার করা যায়:

  • wellbeing-এর কোন নির্দিষ্ট ঝুঁকি বা ইতিবাচক ফল মাপা হবে এবং কেন;
  • multi-turn scenario-তে প্রেক্ষাপট ও ঝুঁকি কীভাবে বদলাবে;
  • pass, fail, harmful compliance ও overrefusal-এর operational definition;
  • clinician ও অন্য domain expert-এর নকশা এবং validation-এ ভূমিকা;
  • human judgment-এর বিপরীতে automated grader যাচাইয়ের পদ্ধতি;
  • open-source deliverable, পুনরুৎপাদনযোগ্যতা, privacy এবং গবেষণার সীমাবদ্ধতা।

৫০ লাখ ডলার পুরো কর্মসূচির মোট অঙ্গীকার; প্রত্যেক প্রকল্পকে ওই পরিমাণ অর্থ দেওয়ার ঘোষণা নয়। বর্তমানে নিশ্চিত সময়সূচি হলো ২১ সেপ্টেম্বর পর্যন্ত আবেদন গ্রহণ এবং পূর্ণ proposal-এর জন্য বাছাই হওয়া আবেদনকারীদের ৫ অক্টোবরের মধ্যে জানানো। কতটি দল অর্থায়ন পাবে, প্রতিটি অনুদানের অঙ্ক কত হবে এবং কোন ভাষা, ব্যবহারকারী গোষ্ঠী বা ঝুঁকির evaluation শেষ পর্যন্ত নির্বাচিত হবে—এসব এখনো প্রকাশ করা হয়নি।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0