প্রযুক্তি ও উদ্ভাবন

Cloudflare-এ AI bot বন্ধ করেও Search চালু রাখা যায়—তিন policy আলাদা করুন

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 1
Cloudflare-এ AI bot বন্ধ করেও Search চালু রাখা যায়—তিন policy আলাদা করুন

Cloudflare-এ AI training crawler বন্ধ রেখে search crawler চালু রাখতে Search, Agent ও Training—তিনটি policy আলাদাভাবে নির্ধারণ করুন। Search-এ Allow, Training-এ Block এবং real-time agent না চাইলে Agent-এও Block দিন।

এই বিন্যাসে Cloudflare-এর AI bot policy Search শ্রেণিতে নতুন block যোগ করবে না, কিন্তু search engine-এ crawling বা indexing নিশ্চিতও করবে না। WAF custom rule, অন্য bot protection, robots.txt এবং origin-এর response আলাদাভাবে Search request থামাতে পারে।

তিন behavior class-এর পার্থক্য

একই domain-এর crawler request Search, Agent ও Training আচরণে আলাদা হচ্ছে

Cloudflare crawler-কে কেবল নাম দিয়ে নয়, ব্যবহারের আচরণ দিয়ে Search, Agent ও Training শ্রেণিতে ভাগ করে। Search crawler পরে প্রশ্নের উত্তর দিতে content সংগ্রহ বা index করে; Agent ব্যবহারকারীর হয়ে real time-এ page আনে বা browser-use কাজ করে; Training crawler model train বা fine-tune করার জন্য content নেয়। Search ও Training—দুই উদ্দেশ্যে ব্যবহৃত mixed-purpose crawler-ও Training শ্রেণির অন্তর্ভুক্ত।

Cloudflare-এর AI bot policy নথি অনুযায়ী প্রতিটি শ্রেণিতে Block on all pages, Block on pages with ads অথবা Allow বেছে নেওয়া যায়। ১৫ সেপ্টেম্বর ২০২৬ থেকে Cloudflare-এ যুক্ত নতুন domain-এ বিজ্ঞাপনযুক্ত page-এর Agent ও Training bot defaultভাবে blocked হবে, Search allowed থাকবে এবং Training block mixed-purpose crawler-কেও আটকাবে।

এটি সব domain-এর জন্য একই বর্তমান configuration নয়। পরিবর্তনটি নতুন domain-এর default, আর Block on pages with ads কেবল Cloudflare বিজ্ঞাপন শনাক্ত করা page-এ প্রযোজ্য; পুরোনো domain বা আগে সম্পাদিত configuration-এর কার্যকর action dashboard-এ দেখে নিতে হবে। পুরোনো Block AI bots option-টি ১৫ সেপ্টেম্বর অবলুপ্তির পথে যাবে; তার আগে সেটি mixed-purpose bot বাদ দেয়।

Dashboard-এ policy বসানোর ধাপ

Production zone বদলানোর আগে তিনটি বর্তমান action, পুরোনো Block AI bots option এবং প্রাসঙ্গিক security rule নথিবদ্ধ করুন। পরিবর্তনের পর request log বা Security Events দেখার সুযোগ আছে—এমন সময়ে কাজটি করলে অনিচ্ছাকৃত block দ্রুত শনাক্ত করা সহজ হবে।

  1. Cloudflare dashboard-এ প্রয়োজনীয় account ও domain নির্বাচন করুন।
  2. Security Settings খুলে Configure AI bot policies অংশে যান। প্রয়োজন হলে Bot traffic filter ব্যবহার করুন।
  3. Search-এর action হিসেবে Allow (do not block) নির্বাচন করুন। এর অর্থ এই policy Search-classified request-এ blocking যোগ করবে না; এটি অন্য rule bypass করে না।
  4. Training-এ পুরো zone-এর জন্য Block (on all pages) দিন। কেবল বিজ্ঞাপনযুক্ত page রক্ষা করতে চাইলে Block on pages with ads বেছে নেওয়া যায়, তবে বিজ্ঞাপনবিহীন page তখন এই action-এর আওতায় থাকবে না।
  5. real-time assistant ও browser-use agent-ও বন্ধ করতে Agent-এ Block দিন। Agent traffic দরকার হলে Allow রাখা যায়; Search চালু রাখার জন্য Agent Allow করা আবশ্যক নয়।
  6. পরিবর্তন save করে Search, Agent ও Training-এর প্রদর্শিত action আবার মিলিয়ে দেখুন। Legacy option দেখা গেলে সেটিকে নতুন তিন policy-এর বিকল্প ধরে নেবেন না।

Search discovery বজায় রেখে training ও agent access বন্ধ করার সরল baseline হলো Search: Allow, Agent: Block, Training: Block। তবে কোনো প্রয়োজনীয় crawler mixed-purpose হিসেবে শ্রেণিবদ্ধ হলে Training block সেটিকেও আটকাবে; নামের মধ্যে Search থাকলেই ব্যতিক্রম মিলবে না।

Managed robots.txt block নয়

Cloudflare edge-এ Training request বন্ধ হলেও robots.txt আলাদাভাবে crawler নির্দেশ দিচ্ছে

Cloudflare-এর Block action request আটকানোর প্রযুক্তিগত ব্যবস্থা। robots.txt কেবল crawler operator-কে আপনার পছন্দ জানায়; operator নির্দেশ না মানলে file নিজে request ঠেকাতে পারে না। তাই training access কার্যকরভাবে বন্ধ করার লক্ষ্য হলে শুধু Disallow-এর ওপর নির্ভর করা যথেষ্ট নয়।

Managed robots.txt নির্দেশনা অনুযায়ী feature-টি Security Settings-এর Bot traffic অংশ থেকে চালু করা যায় এবং এর compliance স্বেচ্ছামূলক। Origin-এর robots.txt HTTP 200 দিলে Cloudflare নিজের managed content বিদ্যমান file-এর আগে যোগ করে; file না থাকলে পরিচিত AI crawler-এর Disallow rules-সহ নতুন file তৈরি করে।

Managed content-এ search, real-time AI input ও training ব্যবহারের সংকেত আলাদা: উদাহরণস্বরূপ search=yes এবং ai-train=no। তবে Cloudflare পুরোনো file মুছে দেয় না। সেখানে broad User-agent: * Disallow, search bot-এর জন্য আলাদা নিষেধ বা ভুল path rule থাকলে Search policy Allow থাকার পরও crawling ব্যাহত হতে পারে।

আগের security rule Search থামাচ্ছে কি না

Search policy ঠিক থাকলেও বিস্তৃত WAF custom rule বা bot protection আগে request শেষ করে দিতে পারে। User-Agent ধরে blanket block, সব automated traffic-এর challenge এবং verified bot বাদ না দেওয়া rule বিশেষভাবে পরীক্ষা করুন।

Cloudflare-এর custom-rule reference অনুযায়ী custom rule Super Bot Fight Mode-এর managed rule-এর আগে চলে; Block বা Managed Challenge-এর মতো terminating action নিলে request পরের bot setting-এ পৌঁছায় না। Built-in bot setting পুরো domain-এ সমানভাবে চলে, আর path, ASN বা অন্য request field মিলিয়ে শর্ত বসাতে উপযুক্ত plan-এ custom rule প্রয়োজন হতে পারে।

তাই Search: Allow কোনো সর্বজনীন ছাড়পত্র নয়। এটি শুধু Search policy-কে নতুন block যোগ করা থেকে বিরত রাখে। আগের terminating rule search crawler ধরলে rule-এর scope সংশোধন করুন অথবা প্রয়োজন ও plan অনুযায়ী সুনির্দিষ্ট Skip logic ব্যবহার করুন—Training policy খুলে দেওয়া এই সমস্যার সমাধান নয়।

পরিবর্তনের আগে ও পরে audit

Policy বদলের পর Search request, Training block ও robots.txt একসঙ্গে যাচাই

Policy বদলানোর আগে নিচের তথ্য ধরে রাখুন, যাতে পরে traffic বা crawling বদলালে কারণ আলাদা করা যায়:

  • Search, Agent ও Training-এর বর্তমান action এবং legacy Block AI bots option-এর অবস্থা;
  • পরিবেশিত robots.txt response, HTTP status, sitemap line এবং crawler-সংক্রান্ত Allow বা Disallow;
  • WAF custom rule ও অন্য bot setting-এ Block, Challenge, Allow বা Skip action;
  • প্রয়োজনীয় search crawler-এর সাম্প্রতিক request, response status, requested path এবং কোন layer action নিয়েছে;
  • গুরুত্বপূর্ণ page-এর robots meta, X-Robots-Tag, canonical এবং origin response।

Save করার পর প্রথমে robots.txt সরাসরি fetch করুন। Managed অংশের সঙ্গে origin-এর পুরোনো rule দ্বন্দ্ব করছে কি না এবং sitemap অক্ষত আছে কি না মিলিয়ে নিন। এরপর Security Events বা উপলভ্য request log-এ প্রয়োজনীয় search crawler-এর request সফল হচ্ছে এবং Training বা Agent শ্রেণির traffic প্রত্যাশিত action পাচ্ছে কি না দেখুন; শুধু status code নয়, কোন rule action নিয়েছে সেটিও পরীক্ষা করুন।

সবশেষে সংশ্লিষ্ট search engine-এর URL inspection বা live-test সুবিধায় কয়েকটি গুরুত্বপূর্ণ public URL যাচাই করুন এবং পরবর্তী crawl ও indexing pattern পর্যবেক্ষণ করুন। Search request blocked হলে আগে custom rule, অন্য bot protection, robots.txt ও origin response পরীক্ষা করুন। তিন behavior policy ও এই আলাদা audit একসঙ্গে ব্যবহার করলেই training access বন্ধ রেখে search crawling খোলা রাখার সিদ্ধান্তটি যাচাইযোগ্য থাকে।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0