OpenAI-এর ‘research intern’ এসেছে—৩.১ agent-day মানেই তিন গুণ কাজ নয়

OpenAI ৬ সেপ্টেম্বরের গবেষণা প্রকাশনায় জানিয়েছে, নিজস্ব মাপজোক অনুযায়ী তাদের “automated research intern” লক্ষ্য অর্জিত হয়েছে। কোম্পানির সংজ্ঞায় এটি মানুষের নির্দেশনায় সুস্পষ্ট গবেষণাকাজ করতে পারে—এমন কাজও, যা একজন দক্ষ গবেষকের কয়েক দিন লাগতে পারে। একই প্রকাশনায় বলা হয়েছে, আগস্টের মাঝামাঝি OpenAI-এর পুরো গবেষণা সংগঠনে প্রতি আট ঘণ্টার মানব কর্মদিবসের বিপরীতে মোট ৩.১ agent-workday ব্যবহৃত হচ্ছিল।
এটি জনসাধারণের জন্য নতুন পণ্য প্রকাশের ঘোষণা নয়; OpenAI-এর অভ্যন্তরীণ coding-agent কার্যক্রম নিয়ে কোম্পানির দাবি। Silicon Report-এর ৬ সেপ্টেম্বরের প্রতিবেদনে একই মাইলফলক ও ৩.১ অনুপাতের পাশাপাশি জানানো হয়েছে, মধ্যবর্তী গবেষকের inference ব্যবহার API দরে দিনে ৬০০ ডলারের বেশি এবং সর্বোচ্চ ব্যবহারকারীদের ৯০তম percentile-এ দিনে ৭,০০০ ডলারের বেশি ছিল। কিন্তু agent চলার সময়, inference ব্যয় এবং যাচাই করা গবেষণা-ফল তিনটি আলাদা মাপ।
‘Research intern’ বলতে ঠিক কী বোঝানো হয়েছে

OpenAI-এর সংজ্ঞার মূল সীমা হলো সুস্পষ্ট কাজ ও মানব নির্দেশনা। Coding agent কোড লেখা, গবেষণা অবকাঠামোর সমস্যা শনাক্ত করা, experiment চালাতে সহায়তা এবং monitoring-এর মতো দীর্ঘ কাজ নিতে পারে। “কয়েক দিনের কাজ” কথাটি assignment-এর আনুমানিক মানব-সময় বোঝায়; প্রতিটি session কয়েক দিন নিরবচ্ছিন্নভাবে চলে বা স্বাধীন গবেষকের সব দায়িত্ব পালন করে—এমন দাবি নয়।
Agent-কে নিজে গবেষণার অগ্রাধিকার স্থির করা, কোন বৈজ্ঞানিক প্রশ্ন অনুসরণযোগ্য তা চূড়ান্তভাবে বেছে নেওয়া কিংবা ফল production-এ নেওয়ার কর্তৃত্ব দেওয়া হয়েছে—প্রকাশিত তথ্যে এমন প্রমাণ নেই। বরং উচ্চস্তরের planning agent output token-এর সামান্য অংশ হিসেবেই রয়ে গেছে। তাই “intern” একটি অভ্যন্তরীণ সক্ষমতার স্তর, পূর্ণ স্বয়ংক্রিয় গবেষক বা কর্মী প্রতিস্থাপনের ঘোষণা নয়।
পরিমাপের জনসমষ্টিও বিস্তৃত। এখানে “researcher” বলতে শুধু model scientist নয়; গবেষণা অবকাঠামো নির্মাতা, project manager এবং গবেষণা কার্যক্রমে সহায়তাকারী অন্য কর্মীরাও অন্তর্ভুক্ত। ফলে ৩.১ অনুপাতটি একজন মানুষ বনাম একটি agent-এর দক্ষতা-পরীক্ষা নয়, বরং পুরো গবেষণা সংগঠনের সমষ্টিগত ব্যবহারের হিসাব।
৩.১ agent-workday আসলে কী মাপে

একটি standard workday আট ঘণ্টা ধরে agent-গুলোর মোট runtime-কে workday এককে প্রকাশ করা হয়েছে। সেই হিসাবে ৩.১ agent-workday হলো প্রতি আট ঘণ্টা মানবশ্রমের বিপরীতে প্রায় ২৪.৮ agent-hour runtime। একাধিক agent session ও সেগুলো থেকে তৈরি subagent একই সময়ে চলতে পারে বলেই এক মানব কর্মদিবসের মধ্যে আট ঘণ্টার বেশি যান্ত্রিক runtime জমা সম্ভব।
- Agent runtime: গবেষণা সংগঠনের coding agent কতক্ষণ চলেছে, তার যোগফল; সমান্তরাল session-ও এতে যুক্ত হয়।
- Human workday: অনুপাতের denominator হিসেবে ব্যবহৃত আট ঘণ্টার মানদণ্ড; এটি মানুষের মনোযোগ, সিদ্ধান্ত বা review-এর সূক্ষ্ম হিসাব নয়।
- Research output: কোন ফল সঠিক, নতুন, পুনরুৎপাদনযোগ্য বা মূল model-এ ব্যবহারের যোগ্য হয়েছে—৩.১ সংখ্যাটি তা মাপে না।
Runtime-এর ভেতরে সফল ও ব্যর্থ চেষ্টা, পুনরায় চালানো experiment, অপেক্ষা, সংশোধন এবং পরে বাতিল হওয়া output থাকতে পারে। তাই সংখ্যাটি agent-নির্ভর execution capacity কতটা ব্যবহৃত হচ্ছে তার সংকেত; প্রতি ঘণ্টায় মূল্যবান insight বা গ্রহণযোগ্য পরিবর্তন কতটি এসেছে, তার উত্তর নয়। শিরোনামের “তিন গুণ কাজ নয়” সীমাটি এখানেই: agent সময় তিন গুণের বেশি হলেও যাচাই করা গবেষণা-ফল একই হারে বাড়ার প্রমাণ প্রকাশিত হয়নি।
Experiment বেড়েছে, কিন্তু কারণ আলাদা করা যায়নি
২০২৬ সালে সক্রিয় experimenter-পিছু experiment বেড়েছে এবং আগস্টে তা ২০২৫ সালের জানুয়ারিতে tracking শুরুর পর সর্বোচ্চ পর্যায়ে পৌঁছেছে। এই বৃদ্ধি Codex গ্রহণের সঙ্গে সম্পর্কিত হলেও একই সময়ে উপলভ্য compute-ও উল্লেখযোগ্যভাবে বেড়েছে। প্রকাশিত ডেটা agent, অতিরিক্ত compute এবং workflow-এর অন্য পরিবর্তনের পৃথক অবদান নির্ণয় করে না।
গবেষণার pipeline-এ ধারণা নকশা, evaluation তৈরি, অবকাঠামো প্রস্তুত, training বা test চালানো, bug ও অনিরাপদ আচরণ শনাক্ত করা এবং সফল ফল মূল training run-এ যুক্ত করা—সব ধাপ মিলেই অগ্রগতি তৈরি করে। Agent কোড বা experiment দ্রুত করলেও evaluation, compute, safety review বা integration পরবর্তী bottleneck হতে পারে। তাই code volume ও experiment count গুরুত্বপূর্ণ operational signal, কিন্তু বৈজ্ঞানিক মান বা model উন্নতির স্বতন্ত্র মাপ নয়।
Inference ব্যয়ের সংখ্যাগুলোও উৎপাদনশীলতার হিসাব নয়। এগুলো public API price দিয়ে token ব্যবহার মূল্যায়নের অঙ্ক; OpenAI-এর প্রকৃত অভ্যন্তরীণ খরচ, transfer price বা প্রতিটি সফল ফলের ব্যয় প্রকাশ করে না। ফলে বেশি agent-hour-এর সঙ্গে কতটা নিট মূল্য তৈরি হয়েছে, তা নির্ধারণের জন্য ব্যর্থতা, rework এবং মানব review-এর তথ্যও দরকার।
মানুষের steering ও deployment সিদ্ধান্ত বহাল

দীর্ঘ কাজেও মানব হস্তক্ষেপ সাধারণ। AI Understanding-এর স্বাধীন পর্যালোচনায় দেখা যায়, আগের ছয় মাসে সফল বলে শ্রেণিবদ্ধ চার থেকে আট ঘণ্টার কাজের অর্ধেকের বেশি অন্তত একটি মানব intervention নিয়েছে; অনিশ্চিত ফল এবং পর্যাপ্ত session বা user না থাকা data point বিশ্লেষণ থেকে বাদ ছিল। একই পর্যালোচনা বলছে, প্রকাশিত ফল কোনো বাইরের audit, independent benchmark বা পুনরুৎপাদনযোগ্য গবেষণায় যাচাই করা হয়নি।
মানুষ এখনো গবেষণার অগ্রাধিকার ঠিক করে, কোন ধারণা ও ফল অনুসরণ করা হবে তা বিচার করে এবং কোনো system scale, pause বা deploy হবে কি না সিদ্ধান্ত নেয়। এগুলো agent-এর কাজ শেষে যোগ করা আনুষ্ঠানিক অনুমোদনমাত্র নয়; গবেষণার উদ্দেশ্য, গ্রহণযোগ্য প্রমাণ এবং ঝুঁকির সীমা নির্ধারণ করে।
Deployment আরও আলাদা স্তর। গবেষণা-কোড বা experiment result থেকে production system পর্যন্ত যেতে safety review, monitoring, security control ও সাংগঠনিক সিদ্ধান্ত প্রয়োজন। Automated research intern মাইলফলক এই gate-গুলো সরায়নি, আর ২০২৮ সালের মার্চের জন্য ঘোষিত পূর্ণ automated AI researcher লক্ষ্যটিও এখনো ভবিষ্যৎ লক্ষ্য।
দাবিটির প্রমাণ কোথায় থেমে যায়
এখন পর্যন্ত নিশ্চিত বিষয় হলো, OpenAI নিজস্ব সংজ্ঞা ও অভ্যন্তরীণ telemetry অনুযায়ী automated research intern স্তরে পৌঁছানোর দাবি করেছে এবং গবেষণা সংগঠনে মানবসময়ের তুলনায় অনেক বেশি agent runtime চালাচ্ছে। সেই ডেটা কাজের ধরন বদলানোর শক্তিশালী operational signal, কিন্তু তিন গুণ গবেষণা-উৎপাদনশীলতা বা স্বাধীন গবেষক তৈরির প্রমাণ নয়।
এখনো জানা যায়নি ৩.১ agent-workday-এর কত অংশ শেষ পর্যন্ত গ্রহণযোগ্য গবেষণা-ফলে পরিণত হয়েছে, একই ফল agent ছাড়া কত সময় নিত, কিংবা compute ও human review ধরলে নিট উৎপাদনশীলতা কত। দাবিটির পরবর্তী শক্ত পরীক্ষা হবে task sampling ও success-এর পরিষ্কার সংজ্ঞা, ফল পুনরুৎপাদন, error ও rework-এর হার, মানব review-এর সময় এবং deployment পর্যন্ত পৌঁছানো কাজের অনুপাত প্রকাশ করা।
আরও পড়ুন:
আমাদের নিউজলেটার নিন
সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।