এআই ও অটোমেশন

Claude Fable 5.1 দ্বিগুণের বেশি স্কোর করেছে—তবু benchmark একার সিদ্ধান্ত নয়

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 1
Claude Fable 5.1 দ্বিগুণের বেশি স্কোর করেছে—তবু benchmark একার সিদ্ধান্ত নয়

Anthropic ১ সেপ্টেম্বর ২০২৬-এ Claude Fable 5.1 এবং সীমিত-access Claude Mythos 5.1 প্রকাশ করেছে। Decrypt-এর স্বাধীন প্রতিবেদনে প্রকাশের তারিখ, Fable-এর সাধারণ প্রাপ্যতা এবং Terminal-Bench-Science 0.1-এ নতুন মডেলের স্কোর আগের সংস্করণের দ্বিগুণের বেশি হওয়ার তথ্য মেলে।

Fable 5.1 সাধারণ ব্যবহার ও API গ্রাহকদের জন্য এসেছে; একই মূল মডেলের তুলনামূলক কম সীমাবদ্ধ Mythos 5.1 শুধু যাচাইকৃত সাইবার নিরাপত্তা ও জীবনবিজ্ঞান অংশীদারদের জন্য সীমিত। ফলে ৫২.৬% benchmark ফলটি গুরুত্বপূর্ণ উন্নতি দেখালেও মডেল বাছাইয়ে পরীক্ষার পদ্ধতি, safeguard-এর হস্তক্ষেপ, প্রকৃত access এবং workload অনুযায়ী খরচ একসঙ্গে দেখতে হবে।

৫২.৬% স্কোরটি কী মাপে

Terminal-Bench-Science পরীক্ষায় Claude Fable 5.1-এর ৫২.৬% ও Fable 5-এর ২৪.৭% ফল এবং standard error-এর সীমা

Terminal-Bench-Science 0.1 একটি command-line পরিবেশে বৈজ্ঞানিক গবেষণার কাজ সম্পন্ন করার সক্ষমতা মাপে। অর্থাৎ agent-কে তথ্য ও সফটওয়্যার ব্যবহার করে বহু ধাপের task শেষ করতে হয় এবং সফলভাবে শেষ হওয়া task-এর অনুপাতই স্কোরে প্রতিফলিত হয়। এটি সাধারণ কথোপকথন, সব ধরনের coding কিংবা কোনো প্রতিষ্ঠানের সামগ্রিক উৎপাদনশীলতার সরাসরি পরীক্ষা নয়।

Anthropic-এর benchmark সারণি ও footnote অনুযায়ী Fable 5.1-এর ফল ৫২.৬%, যেখানে একই প্রতিষ্ঠানের setup-এ Fable 5 পেয়েছিল ২৪.৭%। নতুন ফলটি আগেরটির প্রায় ২.১৩ গুণ এবং ব্যবধান ২৭.৯ percentage point—তাই শিরোনামের “দ্বিগুণের বেশি” দাবি সংখ্যাগতভাবে সমর্থিত।

তবে Anthropic প্রতি মডেলের standard error ±৩.৫–৪.৫ point বলেছে। public leaderboard-এ তিনবার করে চালানো Claude Code harness-এ Fable 5-এর ফল ছিল ২১.৪%, আর Anthropic-এর setup-এ ২৪.৭%; প্রতিষ্ঠানটি পার্থক্যটিকে ওই অনিশ্চয়তার সীমার মধ্যে রেখেছে। এই error range বড় অগ্রগতিকে বাতিল করে না, কিন্তু ৫২.৬%-কে সব পরিবেশে একইভাবে পাওয়া স্থির ফল হিসেবেও দেখায় না।

সরাসরি তুলনার জন্য task set, agent harness, effort level এবং scoring rule একই হওয়া দরকার। এর যেকোনোটি বদলালে শতাংশও বদলাতে পারে; তাই একটি vendor-run benchmark বাস্তব workload-এ সাফল্যের হার আগাম নিশ্চিত করে না।

Safeguard ফলের অংশ হয়ে গেছে

একই মূল মডেলের Fable 5.1 ও সীমিত-access Mythos 5.1-এ ভিন্ন safeguard প্রয়োগের ফল

Fable 5.1-কে production safeguards সক্রিয় রেখেই মূল্যায়ন করা হয়েছে। Anthropic-এর footnote বলছে, safeguard হস্তক্ষেপ করা OSWorld 2.0 task-এ Fable 5.1 ও Fable 5 শূন্য পেয়েছে; অন্যান্য হস্তক্ষেপের ক্ষেত্রে সাইবার নিরাপত্তার task Claude Opus 4.8 এবং জীববিজ্ঞানের task Claude Opus 5 সম্পন্ন করেছে। ফলে প্রকাশিত সারণির প্রতিটি ঘর শুধু একটি মডেলের বাধাহীন কাঁচা ক্ষমতা মাপে না—কিছু ক্ষেত্রে deployment configuration-এর আচরণও ফলের মধ্যে রয়েছে।

এই সীমাটি Fable ও Mythos-এর Terminal-Bench 4.0 ফলেও দেখা যায়। agentic terminal coding-এর এই পরীক্ষায় Fable 5.1 পেয়েছে ৫৫.৮% এবং Mythos 5.1 পেয়েছে ৬০.৯%; Anthropic ব্যবধানটিকে আগের, কম নির্ভুল cyber safeguards-এর হস্তক্ষেপের সঙ্গে যুক্ত করেছে। একই সঙ্গে Fable 5-এর ৪২.০% ফলের তুলনায় নতুন Fable এগিয়েছে, কিন্তু Mythos-এর বেশি স্কোরকে আলাদা কোনো উন্নততর মূল মডেলের প্রমাণ বলা যাবে না।

Fable ও Mythos-এর আসল ফারাক access-এ

Claude Fable 5.1 workload-এ পুনর্ব্যবহৃত context-এর cache read সাশ্রয় ও অপরিবর্তিত input-output ব্যয়ের পার্থক্য

দুটি নাম আলাদা হলেও Anthropic এগুলোকে একই underlying model হিসেবে বর্ণনা করেছে। Fable 5.1-এর safeguards সাধারণ deployment-এর জন্য নির্ধারিত; Mythos 5.1-এ যাচাইকৃত পেশাজীবীদের নির্দিষ্ট সাইবার নিরাপত্তা ও জীবনবিজ্ঞান গবেষণার উপযোগী তুলনামূলক permissive ব্যবস্থা রয়েছে। বাকি safeguards বহাল থাকে।

Axios-এর launch coverage অনুযায়ী Fable 5.1 সাধারণভাবে উপলভ্য, আর Mythos 5.1 vetted cybersecurity ও life-sciences অংশীদারদের মধ্যেই সীমিত। Anthropic আরও নির্দিষ্ট করে বলেছে, Mythos তখন কেবল কিছু মার্কিন প্রতিষ্ঠানে পাওয়া যাচ্ছিল এবং দেশি-বিদেশি অংশীদারের কাছে access বাড়ানোর কাজ চলছিল। তাই বাংলাদেশ বা ভারতের সাধারণ API গ্রাহক Mythos-এর benchmark দেখে সেটিকে অবিলম্বে ব্যবহারযোগ্য বিকল্প ধরে নিতে পারবেন না।

Fable 5.1 Claude API ছাড়াও Amazon Web Services, Google Cloud এবং Microsoft Azure-এ চালু হয়েছে। Mythos-এর ক্ষেত্রে trusted-access কর্মসূচিতে যাচাই ও অনুমোদন প্রয়োজন; এ পার্থক্য শুধু subscription tier বা model picker-এর নয়।

Cache read ৭৫% সস্তা, পুরো bill নয়

Fable 5.1-এর base token মূল্য Fable 5-এর সমান: প্রতি million input token ১০ ডলার এবং output token ৫০ ডলার। কমেছে শুধু আগে process করা context পুনরায় পড়ার cache-read মূল্য—প্রতি million token ০.২৫ ডলার, অর্থাৎ আগের তুলনায় ৭৫% কম।

Anthropic-এর হিসাবটি ২০২৬ সালের আগস্টে চার সপ্তাহের usage-based billing এবং default effort-এর বাস্তব usage mix থেকে তৈরি। প্রতিষ্ঠানটির হিসাবে সাধারণ workload-এ মোট খরচ প্রায় ২৫% কমে এবং context-heavy, tool-heavy agentic workload-এ সাশ্রয় সর্বোচ্চ প্রায় ৪৫% হতে পারে। এই দুটি হার cache-read unit price-এর ৭৫% ছাড়ের সমার্থক নয়।

কোনো request যদি একই দীর্ঘ context বারবার ব্যবহার না করে, cache hit কম হয় কিংবা bill-এর বড় অংশ নতুন input ও generated output থেকে আসে, মোট সাশ্রয় ঘোষিত সর্বোচ্চ হারের চেয়ে অনেক কম হবে। একটি কাল্পনিক হিসাবে, পুরোনো bill-এর ২০% cache read হলে ওই অংশে ৭৫% ছাড় মোট bill প্রায় ১৫% কমাবে; cache read-এর অংশ ৬০% হলে সাশ্রয় প্রায় ৪৫% হতে পারে, অন্য usage অপরিবর্তিত থাকলে।

Benchmark, access ও খরচ মিলিয়ে যে ছবি পাওয়া যায়

  • বৈজ্ঞানিক terminal task: একই Anthropic setup-এ ৫২.৬% বনাম ২৪.৭% একটি বড় অগ্রগতি। তবে standard error এবং harness-এর পার্থক্য ফলটির নির্ভুলতার সীমা নির্ধারণ করে।
  • Agentic coding: Fable 5.1 পুরোনো Fable-কে ছাড়িয়েছে, কিন্তু safeguard intervention এবং Mythos-এর ভিন্ন deployment score-কে প্রভাবিত করেছে।
  • API ব্যয়: একই context বারবার ব্যবহার করা দীর্ঘ agent session-এ নতুন cache মূল্য গুরুত্বপূর্ণ। নতুন prompt ও output-নির্ভর workload-এ ৭৫% মোট সাশ্রয় ধরে নেওয়া যাবে না।
  • প্রাপ্যতা: Fable 5.1 সাধারণ গ্রাহকের বাস্তব বিকল্প; Mythos 5.1-এর বেশি score সাধারণ access নির্দেশ করে না।

এখন পর্যন্ত প্রমাণিত চিত্র তাই দ্বিমুখী: Fable 5.1 নির্দিষ্ট বৈজ্ঞানিক terminal benchmark-এ আগের সংস্করণের দ্বিগুণের বেশি স্কোর করেছে, কিন্তু ফলটি vendor-reported এবং নির্দিষ্ট setup-এর। স্বাধীন পুনরুৎপাদন, ভিন্ন agent harness-এ ফল এবং cache-hit ratio অনুযায়ী bill breakdown না পাওয়া পর্যন্ত একে প্রতিটি workload-এর গুণমান, প্রাপ্যতা ও মোট খরচের একক রায় হিসেবে ব্যবহার করা যাবে না।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0