ٹیکنالوجی اور جدت

OpenAI کا research intern آ گیا—3.1 agent-days، مگر خود مختاری نہیں

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ| 1
OpenAI کا research intern آ گیا—3.1 agent-days، مگر خود مختاری نہیں

OpenAI کی 6 ستمبر 2026 کی اشاعت میں کمپنی نے اپنی پیمائش کے مطابق داخلی research intern milestone تک پہنچنے کا دعویٰ کیا: ایسا نظام جو انسانی ہدایت میں واضح تحقیقی کام انجام دے سکتا ہے، جن پر ماہر محقق کے کئی دن لگ سکتے ہیں۔ یہ کسی خود مختار سائنس دان یا عوامی service کی ریلیز نہیں، بلکہ OpenAI کے اندر coding agents کی صلاحیت اور استعمال کے بارے میں کمپنی کا ابتدائی نتیجہ ہے۔

اسی 6 ستمبر کے دعوے کی نمایاں تعداد 3.1 agent-workdays فی انسانی workday ہے، جو اگست کے وسط میں پوری research organization کا مجموعی agent effort ظاہر کرتی ہے۔ یہ 3.1 گنا پیداوار یا تین مفید ڈیجیٹل ملازمین کا ثبوت نہیں؛ کامیاب سمجھے گئے چار سے آٹھ گھنٹے کے tasks میں بھی نصف سے زیادہ کو کم از کم ایک انسانی مداخلت درکار ہوئی۔

Research intern حقیقتاً کیا کر سکتا ہے

OpenAI کا متعین تحقیقی task، agent کی execution اور انسان کے پاس حتمی فیصلہ

OpenAI کی تعریف میں “intern” کی اہم شرط well-defined task under human direction ہے۔ انسان مسئلہ، سمت اور قابلِ قبول نتیجے کی حدود طے کرتا ہے؛ agent تحقیق اور infrastructure کا code لکھنے، evaluations بنانے، experiments چلانے، خرابی تلاش کرنے یا نتائج کا ابتدائی تجزیہ کرنے جیسی execution سنبھال سکتا ہے۔

اس دائرے میں کئی دن کا کام کر سکنا اور کئی دن آزادانہ تحقیق کرنا ایک بات نہیں۔ کمپنی کے اعداد میں high-level planning اب بھی agent output tokens کا بہت معمولی حصہ ہے، جبکہ لوگ تحقیقی ترجیحات طے کرتے، قابلِ تعاقب خیالات اور نتائج چنتے اور systems کو scale، pause یا deploy کرنے کا فیصلہ کرتے ہیں۔ غیر متوقع نتیجہ دریافت ہے یا bug، اس کا آخری فیصلہ بھی انسان کے پاس رہتا ہے۔

“آ گیا” کا مطلب اسی داخلی capability milestone کا دعویٰ ہے۔ دستیاب صفحات میں الگ public product، عمومی دستیابی، قیمت یا پاکستان سمیت بیرونی اداروں کے لیے اسی workflow کی release درج نہیں؛ اس لیے اسے خریدنے یا فوراً deploy کرنے کے قابل research-intern service کہنا درست نہیں ہوگا۔

3.1 agent-workdays کیا ناپتے ہیں

3.1 agent-workdays کا runtime، جس کے نتائج مکمل، ناکام اور زیرِ جائزہ حالتوں میں الگ ہیں

3.1 استعمال شدہ agent effort کا تناسب ہے، منظور شدہ نتیجے کا نہیں۔ آٹھ گھنٹے کے معیاری workday کے لحاظ سے، اگست کے وسط تک OpenAI کی research organization نے ہر انسانی workday کے مقابلے میں 3.1 agent-workdays استعمال کیے۔ یہ مجموعی تنظیمی تناسب ہے، فی researcher headcount یا بچائے گئے انسانی وقت کی پیمائش نہیں۔

Shadow کی 7 ستمبر کی تشریح درست طور پر فرق کرتی ہے کہ runtime ایک input ہے، outcome نہیں: ناکام کوشش، دوبارہ چلایا گیا session یا انسانی اصلاح کا محتاج output بھی agent effort بڑھا سکتا ہے۔ عوامی اعداد یہ نہیں بتاتے کہ کتنے outputs بغیر بنیادی rework کے قبول ہوئے، کتنی انسانی محنت بچی یا سائنسی معیار کتنا بہتر ہوا۔

تناسب پھر بھی OpenAI کے اندر کام کے طریقے میں نمایاں تبدیلی دکھاتا ہے۔ جون 2026 سے پہلے مجموعی agent runtime انسانی labor سے کم تھا؛ اگست کے وسط تک تعلق پلٹ چکا تھا، اور زیادہ researchers بیک وقت متعدد sessions چلا رہے تھے۔ مگر concurrency صرف زیادہ کوششیں ممکن بناتی ہے—وہ ہر کوشش کی درستی یا افادیت کی ضمانت نہیں دیتی۔

انسانی مداخلت کہاں باقی ہے

خود مختاری کی واضح حد نسبتاً طویل، کامیاب قرار دیے گئے tasks میں سامنے آتی ہے۔ گزشتہ چھ ماہ کے داخلی تجزیے میں، چار سے آٹھ گھنٹے کی تخمینی انسانی مدت والے کامیاب tasks میں نصف سے زیادہ کے دوران ایک یا زیادہ interventions ہوئیں۔ یعنی یہ صرف ناکام runs کا مسئلہ نہیں؛ آخری نتیجہ کامیاب شمار ہونے کے باوجود انسان کو راستے میں agent کی سمت درست کرنا پڑی۔

Model Current کی 7 ستمبر کی رپورٹ نے ان اعداد کو OpenAI کے داخلی اور ابتدائی measurements کے طور پر بیان کیا ہے، نہ کہ آزادانہ طور پر تصدیق شدہ سائنسی پیش رفت۔ اس فرق کی وجہ یہ ہے کہ code، runtime اور experiments گنے جا سکتے ہیں، مگر مضبوط insight، محفوظ نتیجہ یا قابلِ تکرار تحقیق ثابت کرنے کے لیے الگ معیار درکار ہوتا ہے۔

مداخلت میں مبہم ہدایت کو محدود کرنا، اضافی context دینا، غلط راستے سے واپس لانا یا نتیجہ قبول کرنے سے پہلے test کی تعبیر جانچنا شامل ہو سکتا ہے۔ شائع شدہ مواد ہر intervention کی نوعیت، مدت یا انسانی لاگت کی مکمل breakdown نہیں دیتا؛ اس لیے ایک intervention کو محض معمولی click یا پورا task دوبارہ کرنے کے برابر سمجھنے کی بنیاد موجود نہیں۔

پاکستانی ٹیم output کو کیسے پرکھ سکتی ہے

پاکستانی ٹیم agent outputs کو قبول، دوبارہ جانچ اور رد کے خانوں میں تقسیم کر رہی ہے

پاکستانی research یا software team کے لیے متعلقہ نتیجہ agent-hours بڑھانا نہیں، بلکہ runtime اور قبول شدہ output کو الگ ریکارڈ کرنا ہے۔ OpenAI کا تناسب ایک مخصوص داخلی lab کا استعمال بیان کرتا ہے؛ دوسری ٹیم میں مختلف codebase، compute، data access، security controls اور reviewer expertise کے باعث وہی تناسب مختلف نتیجہ دے سکتا ہے۔

ایک مختصر decision framework تین حالتیں الگ رکھ سکتا ہے:

  • قبول: output متعین سوال کا جواب دے، ضروری tests یا حوالہ جاتی ثبوت موجود ہوں اور نامزد reviewer اسے بنیادی rework کے بغیر منظور کرے۔
  • دوبارہ جانچ: نتیجہ ممکن ہو مگر source trail، reproducibility، security یا edge cases نامکمل ہوں؛ follow-up محدود رکھا جائے اور انسانی review time بھی درج ہو۔
  • رد: output شرط سے ہٹے، evidence سے متصادم ہو، لازمی test میں ناکام رہے یا اسے درست کرنے کی انسانی لاگت دوبارہ کام کرنے سے زیادہ ہو۔

یہ OpenAI کا شائع کردہ benchmark نہیں بلکہ خبر میں موجود runtime اور intervention metrics کو فیصلہ جاتی پیمانے سے الگ رکھنے کا ادارتی framework ہے۔ مفید داخلی جائزہ agent runtime کے ساتھ acceptance rate، reviewer time، rework، compute cost اور قبول شدہ نتیجے تک مجموعی مدت بھی دیکھے گا۔

ابھی کیا ثابت ہونا باقی ہے

فی الحال تصدیق شدہ واقعہ یہ ہے کہ OpenAI نے اپنے مقرر کردہ، انسانی ہدایت والے research intern milestone تک پہنچنے کا داخلی دعویٰ شائع کیا اور agent effort کے لیے 3.1 کا تنظیمی تناسب بتایا۔ اعداد یہ ثابت نہیں کرتے کہ agent خود اہم تحقیقی سوال منتخب کرتا، اپنے نتیجے کا آخری معیار طے کرتا یا انسانی researcher کی جگہ لے چکا ہے۔

اگلی مفید disclosure محض مزید runtime نہیں ہوگی۔ اصل سوال یہ ہیں کہ کتنے tasks بغیر intervention مکمل ہوئے، experts نے کتنے outputs قبول کیے، review اور rework میں کتنا وقت لگا، اور اضافی compute سے قابلِ تکرار تحقیق کتنی بہتر ہوئی۔ جب تک ایسے outcome metrics یا بیرونی جانچ دستیاب نہیں ہوتی، 3.1 کو بڑے پیمانے کی داخلی agent activity سمجھنا درست ہے—خود مختار تحقیق یا تین گنا productivity نہیں۔

یہ بھی پڑھیں:

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0