এআই ও অটোমেশন

ChatGPT নম্বর বাড়িয়েছে, মৌলিকতা নয়—১,০৫৩ শিক্ষার্থীর পরীক্ষা

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 2
ChatGPT নম্বর বাড়িয়েছে, মৌলিকতা নয়—১,০৫৩ শিক্ষার্থীর পরীক্ষা

বোকোনি বিশ্ববিদ্যালয়ের ১,০৫৩ জন প্রথম বর্ষের শিক্ষার্থীকে নিয়ে করা randomized controlled trial-এ ChatGPT ব্যবহারের সুযোগ নির্ধারিত রুব্রিকের নম্বর বাড়িয়েছে, কিন্তু ধারণার বৈচিত্র্য বাড়ায়নি। বোকোনির গবেষক ও OpenAI Economic Research-এর সহযোগিতায় করা পরীক্ষার ফল ২৭ আগস্ট ২০২৬ প্রকাশিত হয়; OpenAI-এর গবেষণা-সারাংশে ChatGPT ও causal-reasoning প্রশিক্ষণের এই পৃথক, পরিপূরক ফল তুলে ধরা হয়েছে।

অর্থনীতি, ব্যবস্থাপনা ও ফাইন্যান্সের শিক্ষার্থীদের class period অনুযায়ী চারটি অবস্থায় দৈবভাবে ভাগ করা হয়েছিল: শুধু ChatGPT Edu-তে GPT-4o ব্যবহারের সুযোগ, শুধু causal-reasoning প্রশিক্ষণ, দুটিই, অথবা কোনোটিই নয়। বোকোনির ২৭ আগস্টের প্রতিবেদনে বলা হয়েছে, AI ব্যবহারের সুযোগ পাঁচ-পয়েন্ট স্কেলে নম্বর গড়ে প্রায় ০.৮৬ পয়েন্ট বাড়িয়েছে; অন্যদিকে reasoning প্রশিক্ষণ পাওয়া শিক্ষার্থীরা সহপাঠীদের তুলনায় বেশি স্বতন্ত্র ধারণা দিলেও প্রচলিত নম্বরে তার সুবিধা দেখা যায়নি।

চারটি দল একই বিপণন সমস্যার সমাধান করেছে

একই বিপণন সমস্যায় ChatGPT, causal-reasoning প্রশিক্ষণ, উভয়টি বা কোনোটিই নয়—এই চার শর্তে শিক্ষার্থীদের কাজ

এটি সাধারণ জ্ঞান, দীর্ঘমেয়াদি শেখা বা সব ধরনের সৃজনশীলতার পরীক্ষা ছিল না। অংশগ্রহণকারীরা বোকোনির merchandise store সম্পর্কে alumni-দের সচেতনতা ও ব্যবহার বাড়ানোর জন্য বিপণন-প্রস্তাব তৈরি করেন। ফলে কাজটির লক্ষ্য ও মূল্যায়নের মানদণ্ড আগে থেকেই সুসংজ্ঞায়িত ছিল।

causal-reasoning প্রশিক্ষণটি AI ব্যবহারের পাঠ ছিল না। একটি game, উদাহরণ, প্রশ্ন ও feedback-এর মাধ্যমে কারণ–ফল সম্পর্ক, কোনো সমাধান কেন কাজ করতে পারে এবং কোন পরিস্থিতিতে ব্যর্থ হতে পারে—এসব বিশ্লেষণের অনুশীলন করানো হয়েছিল।

জমা দেওয়া কাজ trained human grader-রা পাঁচ-পয়েন্ট rubric দিয়ে মূল্যায়ন করেন। আলাদাভাবে automated text analysis ব্যবহার করে ধারণার সংখ্যা ও বৈচিত্র্য, causal reasoning-এর চিহ্ন এবং তিন বিশেষজ্ঞের তৈরি উত্তরের সঙ্গে মিল মাপা হয়। গবেষণাটি তাই একই লেখার মানদণ্ডভিত্তিক কার্যকারিতাধারণাগত বৈচিত্র্য এক ফল হিসেবে ধরেনি।

ChatGPT কোথায় বাড়তি সুবিধা দিয়েছে

ChatGPT-সহ শিক্ষার্থীর সুসংগঠিত বিপণন প্রস্তাব পাঁচ-পয়েন্ট রুব্রিক ও বিশেষজ্ঞের উত্তরের সঙ্গে মূল্যায়ন

নির্ধারিত বিপণন-লক্ষ্যের বিচারে AI ব্যবহারের সুযোগ পাওয়া শিক্ষার্থীদের কাজ বেশি নম্বর পেয়েছে। নিয়ন্ত্রণ দলের অনুমানভিত্তিক গড় স্কোর ছিল ২.০৯; ChatGPT ব্যবহারের সুযোগের আনুমানিক প্রভাব ছিল তার ওপর ০.৮৬ পয়েন্ট। AI-সহ উত্তরগুলোতে ধারণার সংখ্যা বেশি ছিল, যুক্তির ধারাবাহিকতা ছিল পরিষ্কার এবং তিন বিশেষজ্ঞের প্রস্তাবের সঙ্গে সাদৃশ্যও ছিল বেশি।

ভাষাগত coherence ও বেশি ধারণা মিলে ChatGPT-র প্রভাবের প্রায় অর্ধেক ব্যাখ্যা করেছে। বাকি ব্যবধান থেকে গবেষকেরা ধারণা করেছেন, এই সুসংজ্ঞায়িত কাজে novice শিক্ষার্থীরা শুধু লেখার ভঙ্গিতে নয়, বিষয়বস্তুর দিক থেকেও বিশেষজ্ঞসদৃশ সমাধানের কাছাকাছি গিয়েছিল। তবে শিক্ষার্থীদের কী জানতে চাইতে হবে, পাওয়া উত্তর কীভাবে বিচার করতে হবে এবং চূড়ান্ত প্রস্তাবে কী রাখা হবে—সেই সিদ্ধান্ত নিতে হয়েছে।

এখানে “নম্বর বেড়েছে” বলতে এই নির্দিষ্ট business task ও পাঁচ-পয়েন্ট rubric-এ ভালো ফল বোঝানো হচ্ছে। পরীক্ষা থেকে ChatGPT শিক্ষার্থীদের স্থায়ী জ্ঞান, AI ছাড়া নতুন সমস্যা সমাধানের ক্ষমতা বা সাধারণ critical-thinking skill বাড়িয়েছে—এমন সিদ্ধান্ত নেওয়া যায় না। AI সরিয়ে নেওয়ার পর একই দক্ষতা বজায় ছিল কি না, তেমন কোনো transfer test-ও এই গবেষণায় ছিল না।

Reasoning প্রশিক্ষণ নম্বরে ধরা পড়েনি কেন

causal-reasoning প্রশিক্ষণ পাওয়া শিক্ষার্থীরা কোনো ধারণা কেন কাজ করবে, কোন mechanism ফল তৈরি করবে এবং কোথায় প্রস্তাব ব্যর্থ হতে পারে—এসব বেশি স্পষ্টভাবে ব্যাখ্যা করেছে। তাদের প্রস্তাবের ধারণাগুলো অন্য অংশগ্রহণকারীদের ধারণা থেকে তুলনামূলকভাবে বেশি আলাদা ছিল। কিন্তু alumni awareness ও store usage বাড়ানোর নির্ধারিত মানদণ্ডের rubric এই বৈচিত্র্যকে আলাদা করে পুরস্কৃত করেনি।

CEPR Discussion Paper No. 21882-এর নথিতে ২×২ randomized design ও ১,০৫৩ শিক্ষার্থীর নমুনা নিশ্চিত করে বলা হয়েছে, causal-reasoning প্রশিক্ষণ mechanism-ভিত্তিক সমাধান ও ধারণার বৈচিত্র্য বাড়ালেও standard evaluation বাড়ায়নি। ChatGPT-র সঙ্গে প্রশিক্ষণ মিললে coherent logic, সম্ভাব্য ব্যাখ্যাকে ভুল প্রমাণের চেষ্টা এবং অন্তর্নিহিত কারণ অনুসন্ধানের চিহ্নও বেশি দেখা গেছে।

দুই হস্তক্ষেপ তাই একই পথে কাজ করেনি। শুধু ChatGPT পাওয়া দল rubric score ও ধারণার সংখ্যায় এগিয়েছে; শুধু reasoning প্রশিক্ষণ পাওয়া দল ধারণার বৈচিত্র্যে এগিয়েছে। উভয়টি পাওয়া দলের score ও ধারণার সংখ্যা ছিল মোটামুটি ChatGPT-only দলের মতো, আর তাদের idea variety ছিল training-only দলের কাছাকাছি। সম্মিলিত দল সবচেয়ে বেশি ধরনের সূচকে লাভ দেখালেও ফলগুলোকে সব ক্ষেত্রে দ্বিগুণ বা সরল যোগফল বলা যাবে না।

চূড়ান্ত উত্তর দিয়ে শেখা মাপার সীমা

একই শিক্ষার্থী-উত্তরে প্রচলিত রুব্রিকের নম্বর ও reasoning–মৌলিকতার পৃথক মূল্যায়ন

পরীক্ষাটি ChatGPT “ভালো” না “খারাপ”—এমন দ্বিমুখী রায় দেয় না। বরং AI কোনো novice-এর final answer-কে দ্রুত সুসংগঠিত, বেশি ধারণাসমৃদ্ধ ও expert-like করে তুললে শুধু সেই উত্তর দেখে শিক্ষার্থী নিজে কতটা বুঝেছে, তা আলাদা করা কঠিন হয়। একই সঙ্গে rubric প্রত্যাশিত সমাধানকে পুরস্কৃত করলে অপ্রচলিত কিন্তু যুক্তিসংগত ধারণা নম্বরে অদৃশ্য থাকতে পারে।

বাংলাদেশ ও ভারতের বাংলা ভাষার শিক্ষাব্যবস্থার জন্য সরাসরি প্রমাণ নয়, তবে ফলটি একটি গুরুত্বপূর্ণ measurement gap দেখায়। একটি polished assignment ভালো tool use, সম্পাদনা, বিষয়গত বোঝাপড়া কিংবা মডেলের শক্তিশালী সহায়তার যেকোনো সমন্বয় প্রকাশ করতে পারে। লক্ষ্য যদি reasoning process বা originality মাপা হয়, final prose-এর গুণমান একা যথেষ্ট প্রমাণ নয়—যদিও এই গবেষণা কোনো বিকল্প assessment policy পরীক্ষা করেনি।

গবেষণায় originality-ও সর্বজনীন অর্থে মাপা হয়নি। সূচকটি ছিল অংশগ্রহণকারীদের লেখায় পাওয়া ধারণার পারস্পরিক বৈচিত্র্য ও স্বাতন্ত্র্য; শিল্পসৃজন, দীর্ঘমেয়াদি উদ্ভাবনী ক্ষমতা বা ব্যক্তিগত authorship নয়। তাই শিরোনামের “মৌলিকতা নয়” বলতে বোঝায়, এই task-এ ChatGPT ধারণার বৈচিত্র্য বাড়ানোর চালক ছিল না; ChatGPT মৌলিকতা কমিয়েছে, এমন ফল গবেষণাটি দেয়নি।

একটি পরীক্ষা থেকে যা এখনো জানা যায় না

দৈব বরাদ্দ এই নির্দিষ্ট কাজের চার অবস্থার তুলনাকে শক্তিশালী করেছে, কিন্তু পরীক্ষাটি একটি বিশ্ববিদ্যালয়, প্রথম বর্ষের তিনটি বিষয় এবং একটিমাত্র সুসংজ্ঞায়িত marketing task-এ সীমিত। ব্যবহৃত হয়েছে ChatGPT Edu-তে GPT-4o। অন্য মডেল, বাংলা ভাষার কাজ, গণিত, ইতিহাস, মুক্ত সৃজনশীল লেখা বা উচ্চঝুঁকির পরীক্ষায় একই মাত্রার ফল হবে কি না, গবেষণাটি জানায় না।

গবেষণাটি বর্তমানে CEPR discussion paper হিসেবে প্রকাশিত; এতে দীর্ঘমেয়াদি learning retention বা AI ছাড়া পরবর্তী transfer test-এর ফল নেই। নিশ্চিত সিদ্ধান্তটি তাই সীমিত: ChatGPT মানদণ্ডনির্ভর final answer-এর স্কোর বাড়িয়েছে, causal-reasoning training বেশি বৈচিত্র্যময় চিন্তার সঙ্গে যুক্ত হয়েছে, আর ব্যবহৃত rubric দুই অর্জনকে সমানভাবে ধরেনি। ভিন্ন ভাষা, বিষয়, বয়স ও assessment design-এ পুনরাবৃত্ত পরীক্ষা ছাড়া এই ফল থেকে বিস্তৃত শিক্ষানীতি নির্ধারণ করা যাবে না।

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0