Claude Fable 5.1-এ cache read ৭৫% সস্তা—মোট বিল ততটা কমবে না

Anthropic ১ সেপ্টেম্বর ২০২৬-এ Claude Fable 5.1 উন্মুক্ত করেছে। মডেলটি সাধারণভাবে এবং API-তে পাওয়া যাচ্ছে; প্রতি ১০ লাখ base input token-এর দাম ১০ ডলার ও output token-এর দাম ৫০ ডলার অপরিবর্তিত থাকার পাশাপাশি cache ব্যবহারের খরচ ৭৫% কমানোর বিষয়টি Axios-এর প্রকাশনা-দিনের প্রতিবেদনে নিশ্চিত করা হয়েছে।
ওই ১ সেপ্টেম্বরের পরিবর্তনে প্রতি ১০ লাখ cache-read token-এর দাম Fable 5-এর ১ ডলার থেকে ০.২৫ ডলারে নেমেছে। Anthropic-এর আনুষ্ঠানিক মূল্যতথ্যে সাধারণ workload-এ আনুমানিক ২৫% এবং অত্যন্ত agentic workload-এ সর্বোচ্চ প্রায় ৪৫% সাশ্রয়ের কথা বলা হয়েছে। এগুলো সব গ্রাহকের পূর্ণ API বিল ২৫% বা ৪৫% কমার নিশ্চয়তা নয়; ফলটি workload-এর token মিশ্রণের ওপর নির্ভরশীল।
৭৫% কমেছে বিলের একটি অংশ
Fable 5.1-এর usage cost বুঝতে token-কে অন্তত তিন ভাগে দেখতে হবে: নতুন বা uncached input, cache থেকে পড়া আগের input এবং generated output। প্রতি ১০ লাখ token ধরে steady-state হিসাব হলো uncached input × ১০ ডলার, cache read × ০.২৫ ডলার এবং output × ৫০ ডলার। এই তিন খাতের যোগফলই এখানে তুলনা করা usage bill।
Fable 5-এর তুলনায় uncached input ও output-এর unit price বদলায়নি। ফলে cache থেকে পড়া প্রতি ১০ লাখ token-এ ০.৭৫ ডলার সাশ্রয় হলেও নতুন input বা generated response-এর খরচে সরাসরি ছাড় নেই। নিচের শর্তসাপেক্ষ উদাহরণগুলোতে cache তৈরির write token ধরা হয়নি; production invoice-এ এমন token থাকলে তা আলাদা করে যোগ করতে হবে।
এ কারণেই cache-read rate-এর ৭৫% কাট মোট bill-এর ৭৫% কাট নয়। কোনো request-এ cache-read token-এর ভাগ যত বেশি এবং দামী output-এর ভাগ যত কম, নতুন rate-এর প্রভাব তত বড় হবে। Prompt বা context ঘন ঘন বদলালে, cache hit কম হলে কিংবা response দীর্ঘ হলে অপরিবর্তিত খাতগুলোই bill-এর বড় অংশ হয়ে থাকবে।
একই token volume-এ দুই রকম bill

একটি শর্তসাপেক্ষ উদাহরণে মাসে মোট ১০ লাখ input token এবং ১ লাখ output token ধরা যাক। দুই সংস্করণেই output-এর খরচ ৫ ডলার। একই input-output volume রেখে শুধু cache hit rate বদলালে discount-এর প্রকৃত প্রভাব দেখা যায়।
- ২০% cache hit: ৮ লাখ uncached input-এর খরচ ৮ ডলার। Fable 5-এ ২ লাখ cache read-এর খরচ ০.২০ ডলার হওয়ায় মোট bill ১৩.২০ ডলার; Fable 5.1-এ ওই খরচ ০.০৫ ডলার, তাই মোট ১৩.০৫ ডলার। সাশ্রয় ০.১৫ ডলার বা প্রায় ১.১৪%।
- ৮০% cache hit: ২ লাখ uncached input-এর খরচ ২ ডলার। Fable 5-এ ৮ লাখ cache read-সহ মোট bill ৭.৮০ ডলার; Fable 5.1-এ তা ৭.২০ ডলার। সাশ্রয় ০.৬০ ডলার বা প্রায় ৭.৬৯%।
দুই ক্ষেত্রেই cache-read unit price ৭৫% কমেছে, কিন্তু পূর্ণ bill সেই হারে নামেনি। কারণ ৫ ডলারের output charge অপরিবর্তিত এবং cache-এর বাইরে থাকা input-ও আগের rate-এ গণনা হচ্ছে। তাই মোট prompt volume জানাই যথেষ্ট নয়; তার কত token বাস্তবে cache থেকে পড়া হয়েছে, forecast-এ সেটিও প্রয়োজন।
দীর্ঘ agent loop-এ সাশ্রয় বড় হতে পারে

Agent workflow একই system prompt, repository context, tool result বা কথোপকথনের history একাধিক ধাপে আবার পড়তে পারে। এমন loop-এ নতুন input-এর তুলনায় cache-read token-এর অনুপাত বাড়ার সুযোগ থাকে। IT Pro-র ২ সেপ্টেম্বরের প্রতিবেদনে Anthropic-এর সাধারণ workload-এ প্রায় ২৫% এবং অত্যন্ত agentic workload-এ সর্বোচ্চ প্রায় ৪৫% সাশ্রয়ের অনুমান তুলে ধরা হয়েছে; একই প্রতিবেদনে API ও নির্বাচিত cloud platform-এ মডেলটির availability-ও নিশ্চিত করা হয়।
আরেকটি শর্তসাপেক্ষ হিসাবে মোট ৫০ লাখ input token-এর ৯০% cache থেকে পড়া এবং output ১ লাখ token ধরা যাক। Fable 5-এ ৫ লাখ uncached input-এর জন্য ৫ ডলার, ৪৫ লাখ cache read-এর জন্য ৪.৫০ ডলার এবং output-এর জন্য ৫ ডলার—মোট ১৪.৫০ ডলার। Fable 5.1-এ cache অংশ ১.১২৫ ডলারে নামলে মোট হয় ১১.১২৫ ডলার; সাশ্রয় প্রায় ২৩.৩%।
এই হিসাব Anthropic-এর ৪৫% সর্বোচ্চ অনুমান পুনরুৎপাদনের দাবি নয়। Cached context-এর অনুপাত আরও বেশি এবং output কম হলে মোট সাশ্রয় বাড়তে পারে। বিপরীতে agent প্রতিটি ধাপে context বদলালে, নতুন tool output যোগ করলে বা দীর্ঘ উত্তর তৈরি করলে বাস্তব reduction উল্লেখযোগ্যভাবে কম হতে পারে।
Migration-এর আগের cost worksheet

Production log বা billing export থেকে একই সময়সীমার token শ্রেণিগুলো আলাদা করলে দুই সংস্করণের তুলনা করা যায়। শুধু মোট token-এর ওপর ৭৫% discount বসালে সাশ্রয় অতিরঞ্জিত হবে।
- মোট input-এর মধ্যে uncached input, cache read এবং cache write আলাদা করুন।
- Fable 5.1 estimate-এ প্রতি ১০ লাখ uncached input-এর জন্য ১০ ডলার, cache read-এর জন্য ০.২৫ ডলার এবং output-এর জন্য ৫০ ডলার প্রয়োগ করুন।
- Cache write, US-only inference বা ব্যবহৃত cloud marketplace-এর নিজস্ব খরচ থাকলে সংশ্লিষ্ট বর্তমান rate অনুযায়ী আলাদা line item যোগ করুন।
- Fable 5-এর একই token মিশ্রণের মোট থেকে নতুন মোট বাদ দিন; সেই ব্যবধানকে পুরোনো মোট দিয়ে ভাগ করলে workload-specific saving rate পাওয়া যাবে।
- একটি গড়ের বদলে low, median ও high cache-hit period দিয়ে তিনটি scenario চালান, বিশেষত agent loop-এর দৈর্ঘ্য পরিবর্তনশীল হলে।
Claude ব্যবহারের পূর্ণ budget-এ subscription বা seat charge থেকে API usage আলাদা রাখতে token bill-এর পৃথক হিসাব কাজে আসে। Claude Code-এ পুরোনো context বারবার পাঠানো হলে context খরচের নিয়ন্ত্রণ cache hit-এর পাশাপাশি মোট token volume-ও কমাতে পারে।
Availability নিশ্চিত, পূর্ণ সাশ্রয় এখনো workload-নির্ভর
Fable 5.1 Pro, Max, Team ও Enterprise ব্যবহারকারীদের জন্য উপলভ্য; developer-রা Claude Platform, সমর্থিত marketplace, Amazon Web Services, Google Cloud ও Microsoft Foundry দিয়ে মডেলটি ব্যবহার করতে পারেন। API model identifier হলো claude-fable-5-1। বিপরীতে Claude Mythos 5.1 সাধারণভাবে উন্মুক্ত নয়; vetted organization-এর trusted-access কর্মসূচিতে এর ব্যবহার সীমিত।
নিশ্চিত মূল্যপরিবর্তনটি তাই cache read-এর unit rate ১ ডলার থেকে ০.২৫ ডলারে নামা—base input বা output price কমা নয়। বাস্তব invoice-এ কতটা সাশ্রয় হবে, তা নির্ধারণ করবে cache hit rate, uncached input, generated output, cache write এবং agent loop-এর নিজস্ব মিশ্রণ; Anthropic এখনো প্রতিটি workload-এর জন্য একক মোট-discount rate দেয়নি।
আরও পড়ুন:
আমাদের নিউজলেটার নিন
সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।