এআই ও অটোমেশন

OpenAI-এর Jalapeño-তে latency ৩.৬ গুণ কম—দাবির সীমাও বড়

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 1
OpenAI-এর Jalapeño-তে latency ৩.৬ গুণ কম—দাবির সীমাও বড়

OpenAI ২৫ আগস্ট ২০২৬ তার প্রথম custom inference processor Jalapeño-র বিস্তারিত benchmark ফল প্রকাশ করেছে। কোম্পানির প্রকাশিত InferenceX ফল অনুযায়ী, তিনটি public model চালানো Jalapeño system তুলনামূলক commercial systemগুলোর চেয়ে peak throughput-এ প্রতি ওয়াটে ১.৫–১.৯ গুণ বেশি কাজ করেছে এবং end-to-end latency ১.৭–৩.৬ গুণ কমিয়েছে।

একই ২৫ আগস্টের ফলাফলে সর্বোচ্চ latency ব্যবধান এসেছে DeepSeek R1 670B পরীক্ষায়: Jalapeño system-এ request শেষ হয়েছে ১.৬৫ সেকেন্ডে, Nvidia GB300 system-এ ৫.৯৯ সেকেন্ডে। কিন্তু ৩.৬ গুণ সংখ্যাটি নির্দিষ্ট model, configuration ও operating point-এর ফল; training, Vera Rubin বা production-scale reliability এতে পরীক্ষা করা হয়নি।

তিন model-এ ঠিক কী মাপা হয়েছে

InferenceX-এ তিনটি open-weight model চালিয়ে Jalapeño-র latency ও throughput তুলনা

পরীক্ষাটি SemiAnalysis-এর public InferenceX suite ব্যবহার করে সম্পন্ন হয়েছে। Nominal workload ছিল ৮ হাজার input ও ১ হাজার output token, আর প্রধান তুলনা চালানো হয়েছে single-token prediction বা STP mode-এ। Model তিনটি হলো GPT-OSS 120B, DeepSeek R1 670B এবং Kimi K2.5 1T।

InferenceX শুধু chip-এর বিচ্ছিন্ন peak specification মাপে না; একটি AI request পরিবেশনের পুরো পথ ধরে latency, ব্যবহারকারীর কাছে token পৌঁছানোর হার এবং power-normalized throughput তুলনা করে। ফলে প্রকাশিত সংখ্যা Jalapeño processor একটির নয়, processor, memory, networking ও serving software-সহ পরীক্ষিত system configuration-এর ফল।

GPT-OSS 120B-তে Jalapeño-র তুলনা ছিল Nvidia GB200-এর সঙ্গে। Peak mixed throughput ছিল প্রতি কিলোওয়াটে ৮৫,৪৪৮ বনাম ৪৪,৯৬০ এবং end-to-end latency ১.০৩ বনাম ১.৮০ সেকেন্ড—প্রায় ১.৯ গুণ বেশি throughput-per-watt ও ১.৭ গুণ কম latency।

DeepSeek R1-এ GB300-এর বিপরীতে peak mixed throughput ছিল প্রতি কিলোওয়াটে ১৯,৬৪১ বনাম ১১,৭৮১; latency ১.৬৫ বনাম ৫.৯৯ সেকেন্ড। Kimi K2.5-এ মান দুটি ছিল ১৮,১৯৫ বনাম ১১,৮৬২ এবং ১.৫৬ বনাম ৫.৩১ সেকেন্ড। তাই শিরোনামের ৩.৬ গুণ সব model-এর অভিন্ন ফল নয়—এটি পরীক্ষিত তিনটির মধ্যে সর্বোচ্চ end-to-end latency ব্যবধান।

প্রতি ওয়াটের সুবিধা agent-এর জন্য কেন গুরুত্বপূর্ণ

সমমানের inference request-এ Jalapeño ও Nvidia system-এর প্রতি ওয়াটে সম্পন্ন কাজের তুলনা

OpenAI ফলকে raw speed-এর বদলে প্রতি একক বিদ্যুতে সম্পন্ন কাজের হিসাবে সামনে এনেছে। তুলনায় Jalapeño package-এর published power rating ছিল ৭০০ ওয়াট, GB200-এর ১,২০০ ওয়াট এবং GB300-এর ১,৪০০ ওয়াট। Jalapeño-র measured sustained power পরীক্ষিত workload-এ ৫৫০ ওয়াট বা কম থাকলেও মূল হিসাবটি সব accelerator-এর published package rating দিয়েই স্বাভাবিক করা হয়েছে।

Agent-ভিত্তিক কাজে একটি task শেষ করতে পরপর বহু inference call লাগতে পারে। একটি ধাপের বিলম্ব পরবর্তী ধাপকে আটকে দেওয়ায় প্রতিটি request-এর latency পুরো task-এর সময় বাড়ায়। একই power envelope-এ বেশি request পরিবেশন করা গেলে data center-এর serving capacity বাড়তে পারে, কিন্তু এই benchmark থেকে বিদ্যুৎ বিল, rack-level consumption বা total cost of ownership সরাসরি নির্ধারণ করা যায় না।

দাবি ও তার সীমানা একসঙ্গে রাখলে ফলটি এমন:

  • প্রতি ওয়াটে ১.৫–১.৯ গুণ বেশি peak throughput তিনটি নির্দিষ্ট public model ও InferenceX configuration-এর ফল।
  • ১.৭–৩.৬ গুণ কম end-to-end latency-এর মধ্যে ৩.৬ গুণ শুধু DeepSeek R1 comparison-এর সর্বোচ্চ মান।
  • ৭০০, ১,২০০ ও ১,৪০০ ওয়াট হলো published package rating; পুরো server বা data center-এর মাপা বিদ্যুৎ খরচ নয়।
  • এটি language-model inference serving-এর পরীক্ষা; model training performance সম্পর্কে ফলটি কিছু প্রতিষ্ঠা করে না।

Power boundary ও software mode বদলালে ব্যবধানও বদলায়

GB200 ও GB300-এর সঙ্গে Jalapeño পরীক্ষা, যেখানে Vera Rubin ও training workload তুলনার বাইরে

প্রধান comparison-এ GPT-OSS-এর জন্য Nvidia GB200 এবং DeepSeek R1 ও Kimi K2.5-এর জন্য GB300 ব্যবহৃত হয়েছে। Tom’s Hardware-এর বিশ্লেষণে দেখা যায়, accelerator-পিছু all-in utility power ধরলে ব্যবধান সংকুচিত হয়; GB300-কে multi-token prediction-এ চালানো appendix comparison-এ Jalapeño-র peak efficiency lead প্রায় ১.৫ গুণে নেমে আসে। অর্থাৎ power boundary ও prediction mode বদলালে headline metric-ও বদলায়।

Jalapeño-কে Nvidia Vera Rubin-এর বিরুদ্ধে পরীক্ষা করা হয়নি। তাই এই ফল দিয়ে Nvidia-র পরবর্তী platform-এর তুলনায় Jalapeño দ্রুত বা দক্ষ—এমন সিদ্ধান্ত নেওয়া যায় না। প্রধান পরীক্ষায় দুই পক্ষই STP ব্যবহার করলেও Nvidia-র production deployment-এ multi-token prediction ব্যবহৃত হতে পারে, যা সরাসরি production comparison-কে আরও জটিল করে।

Jalapeño model training-ও করে না। ফলে GB300 বা অন্য general-purpose accelerator-এর সামগ্রিক বিকল্প হিসেবে এর অবস্থান এই পরীক্ষায় নির্ধারিত হয়নি; প্রকাশিত ফল শুধু inference-serving workload নিয়ে।

Public benchmark হলেও production verdict নয়

InferenceX একটি public suite, কিন্তু প্রকাশিত ফল স্বাধীন public leaderboard থেকে সংগৃহীত production telemetry নয়। SemiAnalysis জানিয়েছে যে তার দল OpenAI engineers-এর সঙ্গে কোম্পানির lab-এ benchmark চালিয়েছে; ফল প্রকাশ ও ব্যাখ্যার কেন্দ্রীয় উৎস OpenAI নিজেই। তাই public methodology ফলটিকে পর্যালোচনাযোগ্য করলেও স্বাধীনভাবে পুনরুৎপাদিত production result হিসেবে দেখা ঠিক হবে না।

এখনো দীর্ঘমেয়াদি availability, error rate, thermal behaviour, networking bottleneck এবং বিভিন্ন batch size ও context length-এ performance প্রকাশিত হয়নি। OpenAI-ও বলেছে যে production qualification, software maturity, বড় পরিসরে operation এবং আরও model-এ validation চলমান। এই অনুপস্থিত তথ্যগুলো latency ও power-efficiency সংখ্যাকে বাতিল করে না, তবে reliability ও মোট operating cost সম্পর্কে সিদ্ধান্ত সীমিত রাখে।

Deployment সীমিত, বাইরের cloud instance ঘোষিত নয়

Axios-এর ২৫ আগস্টের প্রতিবেদন অনুযায়ী, OpenAI ২০২৬ সালে সীমিতসংখ্যক Jalapeño system স্থাপন এবং ২০২৭ সালে capacity বাড়ানোর প্রত্যাশা করছে; chipটি অন্যদের কাছে বিক্রির পরিকল্পনাও নেই। ফলে বাংলাদেশ বা ভারতের cloud ক্রেতারা এখনই Jalapeño-কে আলাদা instance হিসেবে procurement তালিকায় রাখতে পারবেন—এমন কোনো availability ঘোষণা হয়নি।

OpenAI বছরের শেষ নাগাদ নিজস্ব compute infrastructure-এ deployment শুরু করার পরিকল্পনা করেছে এবং একই সঙ্গে Nvidia ও অন্য অংশীদারের accelerator training ও inference—দুই ক্ষেত্রেই ব্যবহার চালিয়ে যাবে। Jalapeño তাই আপাতত বাস্তব silicon-এ শক্তিশালী প্রথম inference result, পূর্ণাঙ্গ বাজার-উপলভ্য platform নয়। পরবর্তী নির্ণায়ক তথ্য হবে production-scale telemetry, বিস্তৃত model ও context coverage, সমমানের multi-token setting, total system power এবং Vera Rubin-সহ নতুন প্রতিদ্বন্দ্বীর বিরুদ্ধে একই নিয়মে চালানো ফল।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0