এআই ও অটোমেশন

Gimlet Labs পেল ৩০ কোটি ডলার—বাজি এক GPU নয়, বহু ধরনের chip-এ

|লেখক: QUASA সম্পাদকীয় দল|4 মিনিটের পাঠ| 2
Gimlet Labs পেল ৩০ কোটি ডলার—বাজি এক GPU নয়, বহু ধরনের chip-এ

Gimlet Labs ৪ সেপ্টেম্বর ২০২৬-এ Andreessen Horowitz-এর নেতৃত্বে ৩০ কোটি ডলারের Series B তুলেছে। CEO Zain Asgar-এর সাক্ষাৎকারভিত্তিক Bloomberg News-এর প্রতিবেদনে অর্থায়নের পর প্রতিষ্ঠানটির মূল্যায়ন ৩০০ কোটি ডলার এবং Arm ও Microsoft-এর venture fund M12-কে নতুন বিনিয়োগকারী হিসেবে উল্লেখ করা হয়েছে।

একই দিনে প্রকাশিত অর্থায়নটির প্রযুক্তিগত কেন্দ্র হলো Gimlet-এর multi-silicon inference platform: একটি model বা inference workflow-এর আলাদা অংশ ভিন্ন ধরনের processor-এ চালানো। SiliconANGLE-এর প্রতিবেদনে মোট বাইরের অর্থায়ন ৩৯.২ কোটি ডলার বলা হয়েছে এবং memory-নির্ভর module বেশি onboard memory-যুক্ত accelerator-এ পাঠানোর উদাহরণ দিয়ে architecture-টি ব্যাখ্যা করা হয়েছে।

অর্থায়ন নিশ্চিত, revenue এখনো কোম্পানির দাবি

Gimlet Labs-এর ৩০ কোটি ডলারের Series B এবং managed datacenter capacity সম্প্রসারণের পরিকল্পনা

Gimlet Labs-এর আনুষ্ঠানিক ঘোষণায় Sapphire Ventures, Menlo Ventures, 645 Ventures, Arm, Eclipse, Emergence, Factory, Hudson River Trading, M12, OnePrime Capital, Prosperity7, QuantumLight, Samsung Ventures, Tiger Global Management, Triatomic, Wing Ventures ও XTX Markets-কে অংশগ্রহণকারী হিসেবে তালিকাভুক্ত করা হয়েছে। একই ঘোষণায় প্রতিষ্ঠানটি দাবি করেছে, মার্চের পর বিলিয়ন ডলারের contracted revenue যোগ হয়েছে, datacenter pipeline গিগাওয়াটের ঘরে পৌঁছেছে এবং managed capacity কয়েক শ megawatt-এ নেওয়া হচ্ছে।

এখানে ৩০ কোটি ডলারের funding এবং contracted revenue আলাদা হিসাব। প্রথমটি ঘোষিত equity financing; দ্বিতীয়টি স্বাক্ষরিত চুক্তির সম্ভাব্য মোট মূল্য হতে পারে, যা একই সময়ে হিসাবভুক্ত আয় বা হাতে পাওয়া নগদের সমান নয়। প্রকাশ্য তথ্যে গ্রাহকভিত্তিক breakdown, চুক্তির মেয়াদ, বাতিলের শর্ত কিংবা audited revenue schedule নেই। তাই round ও valuation একাধিক প্রতিবেদনে মেলানো গেলেও বিলিয়ন ডলারের revenue দাবি এখনো কোম্পানির নিজস্ব বাণিজ্যিক উপস্থাপনা।

এক model, একাধিক silicon: ব্যবস্থাটি কী করার কথা

একটি inference request-এর prefill ও decode ভিন্ন accelerator-এ চলার পর একত্রে ফল তৈরি হচ্ছে

Gimlet-এর architecture-এর মূল ধারণা disaggregation। Software stack প্রথমে model বা inference workflow trace করে অংশে ভাগ করে; এরপর latency, throughput, service-level requirement এবং কোন hardware তখন খালি আছে—এসব বিবেচনায় অংশগুলো schedule করে। সম্ভাব্য hardware pool-এ GPU-এর পাশাপাশি CPU, near-memory compute এবং dataflow architecture-ভিত্তিক accelerator থাকতে পারে।

সবচেয়ে পরিচিত বিভাজনটি prefill ও decode phase-এর মধ্যে। Prompt প্রক্রিয়াকরণের prefill সাধারণত বেশি compute-নির্ভর, আর একটির পর একটি token তৈরির decode তুলনামূলকভাবে memory-bandwidth-নির্ভর। দুটি phase আলাদা device-এ পাঠানোর উদ্দেশ্য হলো একই processor-কে দুই ধরনের bottleneck একসঙ্গে সামলাতে না দেওয়া।

Platform-টির বর্ণনায় এর চেয়েও সূক্ষ্ম বিভাজন আছে। Speculative decoding-এ ছোট drafter model ও বড় যাচাইকারী model আলাদা accelerator-এ চলতে পারে; attention এবং feed-forward network অংশও পৃথক করা যায়। কোনো নির্দিষ্ট accelerator পূর্ণ ব্যস্ত হলে runtime অন্য উপযুক্ত hardware-এ কাজ সরিয়ে capacity পুনর্বিন্যাস করার কথা।

এ কাজ শুধু request routing নয়। আলাদা instruction set, memory layout ও execution characteristic-এর কারণে প্রতিটি অংশকে লক্ষ্য hardware-এর জন্য compile ও optimize করতে হয়। পাশাপাশি runtime-কে network transfer, queue, synchronization এবং একটি অংশ ব্যর্থ হলে তার প্রভাব সামলাতে হয়। ফলে Gimlet-এর প্রস্তাবটি compiler, scheduler, distributed runtime ও heterogeneous datacenter-কে একটি ব্যবস্থায় আনার চেষ্টা।

পণ্যের কাঠামো দৃশ্যমান, গতি বৃদ্ধির প্রমাণ সীমিত

একই model workload-এ homogeneous GPU ও multi-silicon deployment-এর latency, throughput ও power যাচাই

প্রকাশিত architecture এতটা নির্দিষ্ট যে এর মৌলিক কার্যপদ্ধতি যাচাইযোগ্য: কোন model phase কোথায় চলছে, chip-এর মধ্যে কত data যাচ্ছে এবং সম্পূর্ণ request-এর latency ও throughput কত—এসব মাপা সম্ভব। Software-টি serverless cloud হিসেবে এবং গ্রাহকের নিজস্ব infrastructure-এ managed service হিসেবে দেওয়ার কথা রয়েছে। অর্থাৎ এটি কেবল গবেষণার প্রস্তাব নয়, বাণিজ্যিকভাবে সরবরাহের জন্য উপস্থাপিত platform।

তবে একই power footprint-এ ৫ থেকে ১০ গুণ speedup অথবা একই latency-তে কাছাকাছি মাত্রার throughput বৃদ্ধির সংখ্যা Gimlet-এর নিজের। প্রকাশ্য Series B ঘোষণায় ব্যবহৃত model, batch size, context length, baseline GPU configuration, interconnect, accuracy trade-off এবং মোট serving cost-সহ পূর্ণ benchmark table নেই। তাই সংখ্যাটি সব model, hardware mix বা workload-এ প্রযোজ্য সাধারণ ফল নয়।

একাধিক chip-এ ভাগ করার সুবিধার বিপরীতে communication overhead-ও থাকে। একটি module-এর output অন্য device-এ পৌঁছাতে দেরি হলে, synchronization বাড়লে বা compiler লক্ষ্য hardware-এ কার্যকর code তৈরি করতে না পারলে specialization থেকে পাওয়া লাভ কমে যেতে পারে। সুতরাং module-স্তরের microbenchmark নয়, একই model ও service-level target-এ end-to-end ফলই দাবিটির শক্তি নির্ধারণ করবে।

বাংলাদেশ ও ভারতের infrastructure buyer-এর কাছে কেন গুরুত্বপূর্ণ

এই মডেল কার্যকর হলে cloud buyer-কে প্রতিটি inference workload-এর জন্য একই উচ্চমূল্যের GPU generation-এর ওপর পুরোপুরি নির্ভর করতে হবে না। ভিন্ন vendor ও generation-এর accelerator একটি managed pool-এ ব্যবহার করা গেলে বিদ্যমান CPU বা specialised accelerator কাজে লাগানোর সুযোগ তৈরি হয়। বিদ্যুৎ, rack capacity এবং নতুন GPU সরবরাহ সীমিত বাজারে এই নমনীয়তার অর্থনৈতিক মূল্য থাকতে পারে।

কিন্তু chip-এর বৈচিত্র্য নিজেই সাশ্রয়ের প্রমাণ নয়। সিদ্ধান্তের জন্য পুরো request-এর token latency, sustained throughput, প্রতি watt-এ কাজ, interconnect cost এবং software fee একসঙ্গে দেখতে হবে। Model support, data residency, observability ও SLA-ও গুরুত্বপূর্ণ, কারণ heterogeneous hardware পরিচালনার জটিলতা দূর হচ্ছে না; সেটি buyer-এর কাছ থেকে platform provider-এর software layer-এ স্থানান্তরিত হচ্ছে।

পরবর্তী প্রমাণ হবে পুনরুৎপাদনযোগ্য benchmark

এখন পর্যন্ত নিশ্চিত চিত্রটি দুই ভাগে বিভক্ত। একদিকে ৩০ কোটি ডলারের Series B, Andreessen Horowitz-এর নেতৃত্ব, ৩০০ কোটি ডলারের valuation এবং মোট ৩৯.২ কোটি ডলারের বাইরের funding—এসব প্রকাশ্য উৎসে সামঞ্জস্যপূর্ণ। অন্যদিকে বহু ধরনের accelerator-এ model ভাগ করার architecture স্পষ্ট হলেও revenue, capacity ও performance-এর সবচেয়ে বড় সংখ্যাগুলো Gimlet-এর বক্তব্যনির্ভর।

পরবর্তী গুরুত্বপূর্ণ তথ্য হবে নির্দিষ্ট model, context length, batch size, interconnect ও hardware configuration-সহ third-party benchmark; সেই সঙ্গে production SLA এবং ঘোষিত managed capacity বাস্তবে চালু হওয়ার প্রমাণ। এগুলো ছাড়া বলা যায় Gimlet এক-GPU-কেন্দ্রিক inference-এর একটি প্রযুক্তিগতভাবে সুস্পষ্ট বিকল্প নির্মাণ করছে, কিন্তু সেটি বড় পরিসরে বেশি দ্রুত ও সাশ্রয়ী—এই ফল এখনো স্বাধীনভাবে প্রতিষ্ঠিত হয়নি।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0