ব্যবহারিক নির্দেশিকা

OpenAI-তে মানুষের এক দিনের পাশে agent চলে ৩.১ দিন—productivity নয় কেন

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 3
OpenAI-তে মানুষের এক দিনের পাশে agent চলে ৩.১ দিন—productivity নয় কেন

OpenAI ৬ সেপ্টেম্বর প্রকাশ করেছে, মধ্য-আগস্টে তার গবেষণা বিভাগে প্রতি মানব কর্মদিবসের বিপরীতে ৩.১ standard agent-workdays runtime ব্যবহৃত হয়েছে। OpenAI-এর অভ্যন্তরীণ পরিমাপ agent-এর মোট চলার সময়কে আট ঘণ্টার কর্মদিবসে রূপান্তর করে; প্রতিষ্ঠানটি নিজেই ফলগুলোকে প্রাথমিক বলেছে।

সরাসরি উত্তর: ৩.১ সংখ্যাটি coding agent কতক্ষণ চলেছে, তার অনুপাত—গবেষকের উৎপাদনশীলতা বা মূল্যবান গবেষণা ফল ৩.১ গুণ হওয়ার প্রমাণ নয়। এটি OpenAI-এর নিজস্ব কার্যক্রমের একটি snapshot; স্বাধীন audit, সাধারণ benchmark কিংবা agent-এর তৈরি কাজের মানের মাপ নয়।

৩.১ agent-workdays যেভাবে মাপা হয়েছে

OpenAI গবেষণায় এক মানব কর্মদিবসের পাশে একাধিক agent session-এর সমষ্টিগত runtime

OpenAI গবেষণা বিভাগের মোট agent runtime এবং মোট মানব শ্রমকে standard আট ঘণ্টার কর্মদিবসের এককে তুলনা করেছে। সেই হিসাবে ৩.১ agent-workdays মানে প্রতি আট ঘণ্টা মানব শ্রমের পাশে ২৪.৮ ঘণ্টা সমষ্টিগত agent runtime। একাধিক agent একই সময়ে চলতে পারে বলে একটি মানব দিনের মধ্যে এত runtime জমা হওয়া সম্ভব।

এটি headcount বা সম্পন্ন কাজের হিসাব নয়। Model Current-এর বিশ্লেষণ এককটিকে আট ঘণ্টায় রূপান্তরিত runtime হিসেবে ব্যাখ্যা করেছে—কোনো কর্মী, নির্ভরযোগ্য experiment বা বৈজ্ঞানিক ফলের সমতুল্য হিসেবে নয়।

সময়সীমাটিও নির্দিষ্ট: ২০২৬ সালের জুনের আগে গবেষণা বিভাগে মোট agent runtime মোট মানব শ্রমের নিচে ছিল; মধ্য-আগস্টে অনুপাতটি ৩.১-এ পৌঁছায়। আলাদা concurrency পরিমাপে OpenAI ব্যবহারকারীর সরাসরি চালু করা agent এবং সেগুলোর তৈরি subagent-এর দৈনিক peak session দেখেছে। তবে ওই peak session-এর সংখ্যা এবং ৩.১ runtime ratio এক metric নয়।

পরিমাপের আওতায় ‘researcher’ বলতে শুধু সরাসরি model researcher বোঝানো হয়নি; research infrastructure নির্মাতা, project manager এবং গবেষণায় সহায়তাকারী অন্য সদস্যও অন্তর্ভুক্ত। দ্রুত বদলানো tool ও system-এর কারণে coding-agent ব্যবহারের metric অধিকাংশ ব্যবহার ধরলেও সব ব্যবহার ধরে না—এ সীমাবদ্ধতাও OpenAI জানিয়েছে।

চারটি metric চার ধরনের প্রশ্নের উত্তর দেয়

Runtime, inference spend, experiment ও human intervention আলাদা করে যাচাই

Runtime, inference spend, experiments per active experimenter এবং intervention rate-কে এক করলে ৩.১ সংখ্যাটির অর্থ বদলে যায়। এগুলো গবেষণা pipeline-এর পৃথক স্তর মাপে; একটির বৃদ্ধি থেকে পরেরটির সমান বৃদ্ধি ধরে নেওয়া যায় না।

  • Runtime: agent মোট কত সময় সচল ছিল, আট ঘণ্টার এককে তার যোগফল। কাজটি প্রয়োজনীয়, সঠিক, সম্পূর্ণ বা গৃহীত হয়েছে কি না এই metric জানায় না।
  • Inference spend: model চালানোর ব্যবহারকে API মূল্যে মূল্যায়ন। মধ্য-আগস্টে median researcher-এর দৈনিক inference ব্যবহার ৬০০ ডলারের বেশি এবং ৯০তম percentile-এ দৈনিক token ব্যবহার ৭,০০০ ডলারের বেশি ছিল। এগুলো প্রকাশ্য automated researcher-এর দাম বা OpenAI-এর প্রকৃত নগদ খরচ হিসেবে প্রকাশ করা হয়নি।
  • Experiments per active experimenter: সক্রিয় পরীক্ষকপ্রতি experiment-এর সংখ্যা। ২০২৫ সালের জানুয়ারিতে tracking শুরুর পর ২০২৬ সালের আগস্টে এটি সর্বোচ্চ হয়; একই সময়ে উপলভ্য compute-ও উল্লেখযোগ্যভাবে বেড়েছিল।
  • Intervention rate: agent-এর সফল হতে মানুষের steering কতবার প্রয়োজন হয়েছে। পরিচিত outcome-সহ, মানুষের আনুমানিক চার থেকে আট ঘণ্টার কাজের সমান task-এর সফল নমুনায় অর্ধেকের বেশি ক্ষেত্রে অন্তত একটি human intervention ছিল।

প্রথম দুটি মূলত resource input, তৃতীয়টি intermediate activity এবং চতুর্থটি autonomy-র সীমার signal। পুনরুৎপাদনযোগ্য ফল, core model-এ গৃহীত উন্নতি, নিরাপত্তা finding বা সিদ্ধান্তে কাজে লাগা evidence—এসব useful research output-এর কোনোটিই ৩.১ দিয়ে সরাসরি মাপা হয়নি।

Productivity দাবির আগে causal gap কোথায়

OpenAI-এর হিসাবে agent adoption বাড়ার সঙ্গে গবেষকের code contribution এবং সক্রিয় পরীক্ষকপ্রতি experiment বেড়েছে। কিন্তু agent-ই পুরো পরিবর্তনের কারণ—এ সিদ্ধান্ত data থেকে আসে না: একই সময়ে compute বেড়েছে, infrastructure ও task mix বদলেছে এবং গবেষকেরা একসঙ্গে একাধিক session চালাচ্ছেন। ফলে correlation আছে, নির্দিষ্ট causal contribution এখনো আলাদা করা হয়নি।

Success data-রও নির্বাচনী সীমা আছে। বিশ্লেষণে কেবল সেই task রাখা হয়েছে, যেগুলোর ground-truth outcome পাওয়া গেছে; অনিশ্চিত outcome এবং ৫০টির কম session বা ৫০টির কম unique user-সহ data point বাদ দেওয়া হয়েছে। তাই প্রকাশিত trend পুরো task population-এর ব্যর্থ, পরিত্যক্ত বা অস্পষ্ট কাজের পূর্ণ হিসাব নয়।

শেষে রয়েছে integration gap। Agent code লিখতে, evaluation তৈরি করতে বা experiment চালাতে পারলেও মানুষ গবেষণার অগ্রাধিকার ঠিক করে, ফল বিচার করে এবং কোনো system scale, pause বা deploy হবে কি না নির্ধারণ করে। Execution দ্রুত হলে evaluation, safety review, compute allocation বা সিদ্ধান্ত গ্রহণ নতুন bottleneck হতে পারে।

AI Understanding-এর স্বাধীন পর্যালোচনা তাই ৩.১-কে OpenAI-এর preliminary internal runtime metric বলেছে এবং উল্লেখ করেছে যে এর সঙ্গে independent study, public benchmark বা outside audit দেওয়া হয়নি। অর্থাৎ সংখ্যাটি বড় operational shift দেখায়, কিন্তু end-to-end গবেষণা ৩.১ গুণ দ্রুত হওয়ার সিদ্ধান্ত সমর্থন করে না।

নিজস্ব agent pilot-এর সীমিত scorecard

Agent pilot-এ compute ও মানব সংশোধনের পাশে গৃহীত এবং ব্যর্থ গবেষণা ফলের হিসাব

অন্য গবেষণা দল একই ভুল এড়াতে একটি headline ratio-র বদলে input, activity, oversight এবং accepted outcome পাশাপাশি রাখতে পারে। এটি OpenAI-এর ফল পুনরুৎপাদনের পদ্ধতি নয়; সীমিত pilot-এ automation কোথায় বাড়ছে এবং কোথায় তার সুফল আটকে যাচ্ছে, সেটি আলাদা করার scorecard।

  • Agent runtime: মোট active runtime, concurrent session এবং task category আলাদা রাখা।
  • Inference spend: token, compute ও পূর্ণ cost basis একই সময়সীমায় ধরা।
  • Experiment volume: শুরু ও শেষ হওয়া experiment-এর সঙ্গে duplicate, aborted এবং invalid run-ও রাখা।
  • Human intervention: clarification, correction, review, rework এবং তাতে ব্যয় হওয়া মানুষের সময় গণনা করা।
  • Useful output: আগে নির্ধারিত acceptance rule অনুযায়ী reproducible result, গৃহীত change, safety finding বা সিদ্ধান্তে ব্যবহৃত evidence গোনা।

Baseline ও pilot-এর তুলনায় task mix এবং সময়সীমা একই না হলে causal দাবি দুর্বল হবে। একটি শর্তসাপেক্ষ উদাহরণে runtime দ্বিগুণ ও experiment ৫০ শতাংশ বাড়লেও, compute তিন গুণ হলে এবং গৃহীত ফল অপরিবর্তিত থাকলে data বেশি automation activity দেখাবে—প্রমাণিত productivity gain নয়।

৩.১-এর পরে যে প্রমাণ এখনো দরকার

এখন নিশ্চিতভাবে বলা যায়, OpenAI Research-এর কাজে agents বড় execution layer হয়ে উঠেছে: সমষ্টিগত runtime মানব শ্রমকে ছাড়িয়েছে, concurrent ব্যবহার বাড়ছে এবং experiment activity সর্বোচ্চ পর্যায়ে পৌঁছেছে। একই data মানব নিয়ন্ত্রণের স্থায়িত্বও দেখায়—দীর্ঘতর সফল task-এর বড় অংশে intervention লাগে এবং উচ্চপর্যায়ের planning agent output-এর সামান্য অংশ।

অজানা রয়ে গেছে অতিরিক্ত experiment-এর কতটি নতুন, পুনরুৎপাদনযোগ্য ও গ্রহণযোগ্য ফল দিয়েছে; কত কাজ ব্যর্থ বা পুনরায় করতে হয়েছে; এবং পরিবর্তনের কতটা agent, compute, infrastructure বা task selection থেকে এসেছে। এসব আলাদা করতে ভবিষ্যৎ disclosure-এ representative task sampling, failure ও rework rate, মানুষের মোট review time, compute-normalized experiment yield এবং গৃহীত research outcome দরকার হবে।

সেসব evidence না আসা পর্যন্ত ৩.১ হলো OpenAI-এর agent adoption ও execution capacity-র শক্তিশালী অভ্যন্তরীণ signal। গবেষণার মান, বৈজ্ঞানিক অগ্রগতির গতি বা কর্মী প্রতিস্থাপনের multiplier হিসেবে সংখ্যাটি ব্যবহার করার ভিত্তি এখনো নেই।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0