এআই ও অটোমেশন

Red Hat AI 3.5 production-এ agent আনে—EvalHub ও tenant isolation-ই আসল বদল

|লেখক: QUASA সম্পাদকীয় দল|4 মিনিটের পাঠ
Red Hat AI 3.5 production-এ agent আনে—EvalHub ও tenant isolation-ই আসল বদল

Red Hat ৯ সেপ্টেম্বর ২০২৬-এ Red Hat AI 3.5 সাধারণভাবে উন্মুক্ত করেছে। Data Centre Magazine-এর প্রতিবেদন releaseটির সঙ্গে EvalHub, observability dashboard এবং hosted control plane-ভিত্তিক tenant isolation আসার তথ্য নিশ্চিত করেছে।

একই GA release-এ Responses API, built-in RAG, agent template এবং standard ও distributed deployment-এ tool calling production support পেয়েছে। অর্থাৎ Red Hat AI 3.5 agent চালানোর ভিত্তি production-এ আনলেও AutoRAG, agent tracing ও token showback-এর মতো সংশ্লিষ্ট capability এখনো preview—পুরো releaseটির GA status সেগুলোকে production-ready করে না।

EvalHub model approval-এ যাচাইযোগ্য evidence যোগ করছে

Red Hat AI 3.5 EvalHub-এ model ও agent-এর safety benchmark থেকে deployment approval evidence তৈরি হচ্ছে

Regulated workload-এর প্রথম প্রশ্ন হলো, কোনো model, RAG pipeline বা agent production-এ যাওয়ার আগে তার ঝুঁকি কীভাবে মাপা ও নথিভুক্ত করা হবে। GA হওয়া EvalHub নিজস্ব বা পরিবর্তিত model এবং agent-এর বিরুদ্ধে prompt injection, jailbreak ও অন্যান্য safety-focused benchmark চালিয়ে ফল একটি জায়গায় দেখাতে পারে।

AI Model Catalog-এর validated modelগুলোর সঙ্গে Garak benchmark, ব্যক্তিগত তথ্য প্রকাশের ঝুঁকি ও toxicity-সংক্রান্ত ফলও পাওয়া যায়। ফলে platform team provider-এর সাধারণ নিরাপত্তা দাবির বদলে নির্দিষ্ট model ও configuration-এর evaluation record-কে release gate-এর evidence হিসেবে ব্যবহার করতে পারে।

এই evidence compliance সিদ্ধান্তের বিকল্প নয়। EvalHub audit ও compliance reporting-এর উপকরণ তৈরি করতে পারে, কিন্তু কোন score গ্রহণযোগ্য, কোন test বাধ্যতামূলক এবং exception কে অনুমোদন করবে—সেগুলো প্রতিষ্ঠানের policy ও প্রযোজ্য regulator-এর শর্তেই নির্ধারিত হবে।

GA আর preview আলাদা না করলে deployment সিদ্ধান্ত ভুল হবে

Red Hat AI 3.5-এর GA production capability ও preview feature আলাদা করে যাচাই করা হচ্ছে

Red Hat-এর engineering ব্যাখ্যা production readiness-কে trust, control, extensibility ও measurement—এই চার প্রশ্নে ভাগ করে capabilityগুলোর availability status জানিয়েছে। Regulated production-এর জন্য সংক্ষিপ্ত status matrix হলো:

  • GA: EvalHub; Responses API ও built-in RAG; AI Hub-এর agent template; standard ও distributed deployment-এ agent tool calling; priority-aware serving; controlled model deployment; inference-time scaling; native observability; এবং GPU-as-a-Service dashboard।
  • Technology preview: AutoRAG, AutoML, Model-as-a-Service token showback, visual agent tracing ও debugging, gateway স্তরে external tool call যাচাই এবং Amazon EKS-এ llm-d distributed inference।
  • Developer preview: active workbench-এ distributed data processing আনার Kubeflow Spark Operator।
  • অন্য availability: CoreWeave CKS ও Microsoft Azure AKS-এ llm-d distributed inference GA; vLLM Omni-র multimodal serving early access।

এর তাৎপর্য হলো, agent-এর API, retrieval ভিত্তি, template ও tool calling সমর্থিত অবস্থায় ব্যবহার করা যাবে। কিন্তু AutoRAG tuning, visual trace কিংবা token-ভিত্তিক showback-কে একই support ও stability assumption নিয়ে regulated production design-এর আবশ্যিক অংশ করা এখনো যুক্তিসঙ্গত নয়।

Tenant isolation একই cluster-এর boundary ছাড়িয়ে গেছে

OpenShift Virtualization-এ shared GPU hardware-এর ওপর dedicated control plane ও VM দিয়ে tenant আলাদা রাখা হয়েছে

একটি shared cluster-এ namespace ও RBAC দলগুলোর API access এবং project resource আলাদা করে। কিন্তু sensitive data বা proprietary model-এর জন্য শক্ত boundary প্রয়োজন হলে Red Hat-এর আনুষ্ঠানিক release তথ্য অনুযায়ী hosted control plane ও OpenShift Virtualization ব্যবহার করে প্রতিটি tenant-কে dedicated cluster control plane এবং VM-level workload isolation দেওয়া যায়, যদিও নিচের GPU-enabled physical infrastructure shared থাকতে পারে।

এতে তিনটি control আলাদা থাকে। Namespace ও RBAC নির্ধারণ করে কে কোন API ও project resource ব্যবহার করবে; hosted control plane tenantগুলোর cluster-control surface পৃথক করে; আর VM isolation shared host-এ workload boundary শক্ত করে। Infrastructure provider একই underlying environment কেন্দ্রীয়ভাবে পরিচালনা ও upgrade করতে পারে।

এই architecture-কে পূর্ণ regulatory compliance হিসেবে পড়া যাবে না। প্রকাশিত তথ্য data residency, encryption-key ownership বা কোনো নির্দিষ্ট regulator-এর অনুমোদন নিশ্চিত করে না; সেগুলোর জন্য আলাদা control mapping প্রয়োজন। বদলটি হলো, namespace-level separation যথেষ্ট না হলে এখন platformটির সমর্থিত architecture-এর মধ্যেই আরও শক্ত isolation tier বেছে নেওয়া যায়।

Shared GPU dashboard capacity contention দৃশ্যমান করছে

GA GPU-as-a-Service dashboard GPU deployment status, hardware inventory, active utilization এবং allocated ও borrowed capacity দেখায়। Priority-aware serving admission control, fairness policy ও starvation protection দিয়ে latency-sensitive agent request-এর অগ্রাধিকার রক্ষা করে, আর অব্যবহৃত capacity background workload-কে নিতে দেয়।

Capacity review-তে তাই কয়েকটি প্রশ্ন একই operational model-এর মধ্যে আনা যায়:

  • কোন accelerator model ও deployment সচল, এবং compute ও memory utilization কত?
  • প্রতিটি tenant-এর নিজস্ব বরাদ্দ আর সাময়িকভাবে ধার করা capacity-এর ব্যবধান কত?
  • Real-time agent request-এর priority ও admission policy কী, এবং batch workload কখন অপেক্ষা করবে?
  • Project-level serving metric non-admin user-এর কাছে দৃশ্যমান কি না?
  • Model update-এর সময় canary traffic, চলমান request শেষ করা এবং rollback controlled deployment-এ ধরা আছে কি না?

এখানেও একটি গুরুত্বপূর্ণ সীমা আছে। GPU inventory, utilization ও capacity borrowing visibility GA হলেও MaaS showback technology preview। তাই dashboard operational capacity planning-এ ব্যবহারযোগ্য, কিন্তু preview token metering-কে চূড়ান্ত internal billing বা chargeback record ধরে নেওয়া ঠিক হবে না।

Production governance-এ বদলটি কোথায়

Red Hat AI 3.5 agent API ও template-এর পাশাপাশি তিনটি governance concern একই platform layer-এ এনেছে: deployment-পূর্ব evaluation evidence, tenant অনুযায়ী isolation tier এবং shared GPU-র operational visibility। এগুলো আলাদা manual workflow-এর প্রয়োজন পুরোপুরি দূর করে না, তবে model approval, workload boundary ও accelerator capacity-কে একই release decision-এর অংশ করার ভিত্তি দেয়।

বর্তমান অবস্থায় EvalHub, মূল agent foundation, stronger tenant architecture এবং GPU dashboard GA। AutoRAG, agent tracing, gateway validation ও token showback preview থাকায় পরবর্তী গুরুত্বপূর্ণ পরিবর্তন হবে সেগুলোর support status, সীমাবদ্ধতা ও GA timeline স্পষ্ট হওয়া; তার আগে regulated workload-এ এগুলোকে আবশ্যিক production dependency ধরা যাবে না।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0