ব্যবহারিক নির্দেশিকা

AWS-এ আরও ২০ লাখ NVIDIA GPU—ক্লাউড AI ক্ষমতা তিন গুণের পথে

|লেখক: QUASA সম্পাদকীয় দল|4 মিনিটের পাঠ| 13
AWS-এ আরও ২০ লাখ NVIDIA GPU—ক্লাউড AI ক্ষমতা তিন গুণের পথে

AWS ও NVIDIA ২৬ আগস্ট ২০২৬ ঘোষণা করেছে, AWS-এর বৈশ্বিক অবকাঠামোতে অতিরিক্ত ২০ লাখ NVIDIA GPU স্থাপনের পরিকল্পনা রয়েছে। AWS ও NVIDIA-র যৌথ ঘোষণায় মূল স্থাপনকাল ২০২৭–২০২৮ বলা হয়েছে; অর্থাৎ এটি ভবিষ্যৎ পরিকল্পনা, সম্পন্ন মোতায়েন নয়।

মার্চে ২০২৬ থেকে ১০ লাখের বেশি GPU যোগ করার যে পরিকল্পনা প্রকাশিত হয়েছিল, নতুন ২০ লাখ তার অতিরিক্ত। TechCrunch-এর প্রতিবেদনে Blackwell Ultra, Rubin ও Rubin Ultra মডেল, ২০২৭–২০২৮ সময়সীমা এবং আর্থিক শর্ত প্রকাশ না করার বিষয়টি নিশ্চিত করা হয়েছে। দুই পরিকল্পনা মিলিয়ে ঘোষিত সম্প্রসারণ ৩০ লাখের বেশি GPU—আগের পরিকল্পনার প্রায় তিন গুণ; তবে AWS-এর বর্তমানে ব্যবহারযোগ্য মোট AI ক্ষমতা বা কার্যকর throughput ইতিমধ্যে তিন গুণ হয়েছে, এমন দাবি করা যাচ্ছে না।

২০ লাখ GPU স্থাপনের সময়রেখায় একটি গুরুত্বপূর্ণ অস্পষ্টতা

AWS-এর বিদ্যমান GPU অবকাঠামোর পাশে ২০২৭–২০২৮ সালের NVIDIA সার্ভার স্থাপনের জন্য প্রস্তুত নতুন ডেটা সেন্টার সক্ষমতা

যৌথ ঘোষণার হিসাব অনুযায়ী প্রথম ধাপে ২০২৬ থেকে ১০ লাখের বেশি GPU যোগ হওয়ার কথা, আর অতিরিক্ত ২০ লাখ Blackwell Ultra, Rubin ও Rubin Ultra স্থাপন হবে ২০২৭ ও ২০২৮ সালে। এগুলো AWS-এর বিশ্বব্যাপী অবকাঠামো ও AI factory-তে যাবে; কোনো একক দেশ, Region বা ক্লাস্টারের জন্য পুরো সংখ্যাটি নির্ধারিত নয়।

তবে NVIDIA-র একই দিনের বক্তব্যে সময়রেখাটি কিছুটা ভিন্নভাবে উপস্থাপিত হয়েছে। কোম্পানির আয়-আলোচনার প্রতিলিপিতে অতিরিক্ত ২০ লাখ GPU চলতি ত্রৈমাসিক থেকে ২০২৯ অর্থবছরের দ্বিতীয় ত্রৈমাসিক পর্যন্ত স্থাপনের কথা বলা হয়েছে। NVIDIA-র অর্থবছর ও ক্যালেন্ডার বছরের পার্থক্য শেষ সময়টি ব্যাখ্যা করতে পারে, কিন্তু শুরুর সময় নিয়ে যৌথ সংবাদবিজ্ঞপ্তির ২০২৭–২০২৮ কাঠামোর সঙ্গে ভাষাগত অমিল রয়ে গেছে। তাই গ্রাহকের জন্য নিরাপদ সিদ্ধান্ত হলো—স্থাপন পর্যায়ক্রমে হবে, কিন্তু ত্রৈমাসিকভিত্তিক চূড়ান্ত সূচি এখনো প্রকাশিত নয়।

AWS অঞ্চলভিত্তিক বণ্টন, প্রতিটি GPU পরিবারের সংখ্যা, সংশ্লিষ্ট EC2 instance family কিংবা সাধারণ গ্রাহকের availability date জানায়নি। ফলে বাংলাদেশ বা ভারতের নিকটবর্তী Region কত ক্ষমতা পাবে, সেটিও এখন নির্ধারণ করা যায় না।

Trainium থাকা সত্ত্বেও NVIDIA-র অংশ কেন বাড়ছে

একই AWS অবকাঠামোতে NVIDIA GPU ও Trainium accelerator-এর পৃথক কিন্তু সংযুক্ত workload ব্যবস্থা

AWS-এর নিজস্ব Trainium accelerator এবং NVIDIA GPU একই কৌশলের দুই আলাদা স্তর। Trainium AWS-কে নিজস্ব silicon, মূল্য ও অবকাঠামো নকশার ওপর বেশি নিয়ন্ত্রণ দেয়। অন্যদিকে NVIDIA-র CUDA-কেন্দ্রিক সফটওয়্যার, GPU-উপযোগী library, distributed-training ব্যবস্থা এবং বিদ্যমান গ্রাহক codebase এমন একটি প্রস্তুত ecosystem তৈরি করেছে, যা দ্রুত অন্য accelerator-এ সরানো সব workload-এর জন্য সহজ নয়।

নতুন সহযোগিতাও শুধু GPU কেনায় সীমাবদ্ধ নয়। ঘোষণায় Vera CPU, Spectrum networking, Nemotron model, CUDA-X data-processing library এবং robotics platform অন্তর্ভুক্ত রয়েছে। পাশাপাশি AWS ও NVIDIA পরবর্তী Trainium ব্যবস্থায় NVLink Fusion এবং NVIDIA-র custom high-bandwidth memory প্রযুক্তি যুক্ত করার কাজ করছে। অর্থাৎ AWS নিজস্ব accelerator বাদ দিচ্ছে না; বরং Trainium ও NVIDIA GPU-কে একই rack-scale অবকাঠামোয় ব্যবহারের পথ প্রসারিত করছে।

এ কারণেই NVIDIA-নির্ভরতা বাড়ার অর্থ Trainium ব্যর্থ—এমন নয়। AWS এমন গ্রাহকদের জন্য NVIDIA ক্ষমতা বাড়াচ্ছে, যাদের model, kernel, container বা পরিচালন ব্যবস্থা ইতিমধ্যে NVIDIA stack-এর সঙ্গে যুক্ত; একই সঙ্গে নিজস্ব chip দিয়ে বিকল্প economics তৈরির চেষ্টা চালাচ্ছে। তবে NVIDIA hardware, interconnect ও software-এর অংশ যত বাড়বে, সেই ecosystem থেকে স্থানান্তরের প্রযুক্তিগত খরচও কিছু workload-এর ক্ষেত্রে বাড়তে পারে।

NVIDIA না Trainium—workload অনুযায়ী পার্থক্য

NVIDIA সাধারণত বেশি সরাসরি পছন্দ হবে যখন workload-এ CUDA-নির্ভর library, বিশেষ GPU kernel, NVIDIA-তে যাচাই করা serving stack অথবা বড় distributed cluster-এর জন্য প্রস্তুত networking দরকার। বিদ্যমান model দ্রুত চালু করা এবং নতুন GPU প্রজন্মে তুলনামূলক কম পরিবর্তনে যাওয়া অগ্রাধিকার হলে software compatibility গুরুত্বপূর্ণ হয়ে ওঠে।

Trainium বিবেচ্য যখন দল AWS-এর Neuron toolchain গ্রহণ করতে পারে, model architecture সমর্থিত এবং porting ও benchmarking-এর সময় দেওয়া সম্ভব। শুধু accelerator-এর ঘণ্টাপ্রতি দাম দিয়ে তুলনা সম্পূর্ণ হয় না; compilation, engineer time, distributed efficiency, checkpoint portability, latency এবং utilization-ও মোট ব্যয়ে প্রভাব ফেলে।

একই প্রতিষ্ঠানে দুই ধরনের accelerator ব্যবহারের যৌক্তিকতাও থাকতে পারে। উদাহরণ হিসেবে, এটি একটি শর্তসাপেক্ষ বিন্যাস: compatibility-সংবেদনশীল training NVIDIA-তে রেখে স্থিতিশীল inference Trainium-এ নেওয়া যেতে পারে, যদি একই model-এর accuracy, latency ও throughput পরীক্ষায় গ্রহণযোগ্য থাকে। নতুন ঘোষণা কোনো accelerator-কে সব workload-এর জন্য শ্রেষ্ঠ বলে প্রতিষ্ঠা করে না।

বড় capacity pipeline এখনই কম দামের নিশ্চয়তা নয়

অতিরিক্ত ২০ লাখ GPU ভবিষ্যতে AWS-এর সরবরাহভিত্তি বড় করতে পারে, কিন্তু এই সংখ্যা থেকে EC2-এর মূল্যহ্রাস হিসাব করা যায় না। আর্থিক শর্ত, instance configuration, Region-ভিত্তিক rollout এবং on-demand ও reserved capacity-র বণ্টন প্রকাশিত হয়নি। একই সময়ে চাহিদা বাড়তে থাকলে নতুন hardware এলেও উচ্চক্ষমতার cluster-এর ঘাটতি পুরোপুরি নাও কাটতে পারে।

GPU পরিবারের মিশ্রণও গুরুত্বপূর্ণ। Blackwell Ultra, Rubin ও Rubin Ultra একই সময়ে আসবে না এবং তাদের কার্যকর training বা inference ক্ষমতা অভিন্ন নয়। প্রতিটি মডেলের সংখ্যা, cluster network এবং ব্যবহারযোগ্য utilization না জানলে ২০ লাখ GPU-কে নির্দিষ্ট token capacity, training time বা customer workload-এর সংখ্যায় নির্ভরযোগ্যভাবে রূপান্তর করা সম্ভব নয়।

তাই শিরোনামের “তিন গুণ” বর্তমান AWS বহরের মাপ নয়; এটি আগের ১০ লাখের বেশি GPU যোগ করার পরিকল্পনার তুলনায় ঘোষিত সম্প্রসারণের সম্মিলিত আকার। এখন নিশ্চিত হলো বড় capacity pipeline, ২০ লাখ অতিরিক্ত GPU এবং বিস্তৃত NVIDIA integration। মূল্য, অঞ্চলভিত্তিক প্রাপ্যতা, EC2 configuration ও নির্দিষ্ট rollout calendar প্রকাশিত হলে তবেই গ্রাহকের প্রকৃত খরচ ও সক্ষমতার পরিবর্তন হিসাব করা যাবে।

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0