Cloudflare में AI बॉट रोकें, पर खोज क्रॉलर गलती से न खोएँ

Cloudflare में AI प्रशिक्षण बॉट रोकते हुए Googlebot बचाने के लिए Search को अनुमति दें, शुद्ध Training क्रॉलर रोकें और Agent यातायात पर अपने कारोबार के अनुसार निर्णय लें। लेकिन यदि Googlebot जैसे मिश्रित-उद्देश्य क्रॉलर की खोज पहुँच जरूरी है, तो उस पर Training अवरोध लागू नहीं होने देना होगा।
इसकी सीमा स्पष्ट है: 15 सितंबर 2026 से Cloudflare की सबसे कठोर लागू नीति Search और Training दोनों श्रेणियों में आने वाले क्रॉलर को भी रोक सकती है। इसलिए एक ही श्रेणीगत नियम से सभी Training उपयोग रोकना और Googlebot को खुला रखना संभव नहीं है; आपको मिश्रित क्रॉलर वाला बदलाव अस्वीकार करना होगा या Training अवरोध के साथ खोज पहुँच खोने का जोखिम स्वीकार करना होगा।
Search, Agent और Training को अलग समझें
Cloudflare की विन्यास जानकारी Search को बाद में प्रश्नों का उत्तर देने के लिए सामग्री एकत्र या सूचीबद्ध करने वाला व्यवहार, Agent को किसी व्यक्ति की ओर से तत्काल काम करने वाला स्वचालित यातायात और Training को मॉडल के प्रशिक्षण या परिष्करण के लिए सामग्री लेने वाला व्यवहार बताती है। प्रत्येक नीति उस व्यवहार में रखे गए सत्यापित बॉट के साथ अतिरिक्त असत्यापित बॉट को भी प्रभावित कर सकती है।
हर श्रेणी में तीन विकल्प हैं: पूरे क्षेत्र में अवरोध, केवल विज्ञापन दिखाने वाले पृष्ठों पर अवरोध और अनुमति। इससे शुद्ध Training क्रॉलर को रोकना आसान है, पर एक क्रॉलर एक से अधिक श्रेणियों में हो तो अलग-अलग चुनी नीतियाँ स्वतंत्र नहीं रहतीं।
इसीलिए केवल Search के सामने Allow चुनना Googlebot की सुरक्षा की गारंटी नहीं है। यदि वही क्रॉलर Training में भी वर्गीकृत है और उस श्रेणी में Block चुना गया है, तो कठोर नियम जीत सकता है।
अपनी नीति इस निर्णय-वृक्ष से चुनें
- क्या जैविक खोज जरूरी है? यदि हाँ, Search को अनुमति दें और Googlebot की वास्तविक पहुँच को बदलाव की अनिवार्य जाँच बनाएं। यदि वेबसाइट को खोज परिणामों में रखना ही नहीं है, तो यह संतुलन आवश्यक नहीं होगा।
- क्या मॉडल प्रशिक्षण स्वीकार्य है? यदि नहीं, शुद्ध Training क्रॉलर रोकें। मिश्रित क्रॉलर पर भी यही अवरोध लगाने से पहले तय करें कि Googlebot, Applebot और BingBot की पहुँच खोना स्वीकार्य है या नहीं।
- क्या उपयोगकर्ता की ओर से आने वाले Agent उपयोगी हैं? खरीदारी, आरक्षण या उत्पाद तुलना वाली साइट पर वे संभावित ग्राहक यात्रा का भाग हो सकते हैं। सदस्यता या विज्ञापन-आधारित प्रकाशक अलग नीति चुन सकता है; इसे Search का विकल्प न मानें।
- क्या चिंता केवल विज्ञापन वाले पृष्ठों की है? तब पूरे क्षेत्र के बजाय उन्हीं पृष्ठों पर अवरोध चुनें। यदि प्रशिक्षण उपयोग किसी भी सार्वजनिक सामग्री के लिए स्वीकार्य नहीं है, तो पूरे क्षेत्र का अवरोध अधिक सुसंगत है—लेकिन मिश्रित खोज क्रॉलर वाली कीमत बनी रहेगी।
सुरक्षित आरंभिक नीति प्रायः Search की अनुमति, शुद्ध Training का अवरोध और Agent पर अलग व्यावसायिक निर्णय है। “सभी Training रोकें और Googlebot भी बचाएँ” को पूर्ण समाधान न मानें, क्योंकि Cloudflare की वर्गीकरण व्यवस्था में Googlebot स्वयं दोनों व्यवहारों से जुड़ा है।
15 सितंबर को नए और मौजूदा डोमेन पर असर अलग होगा
15 सितंबर 2026 से Cloudflare से जुड़ने वाले नए डोमेन में विज्ञापन दिखाने वाले पृष्ठों पर Training और Agent श्रेणियाँ पहले से अवरुद्ध होंगी, जबकि Search अनुमत रहेगी। उसी दिन मिश्रित Search और Training क्रॉलर सभी लागू व्यवहारों के आधार पर नियंत्रित होंगे; Cloudflare की घोषणा Googlebot, Applebot और BingBot को ऐसे उदाहरणों में रखती है और बताती है कि Training रोकने पर ये भी अवरुद्ध हो सकते हैं।
मौजूदा डोमेन पर नए डोमेन वाला आरंभिक विन्यास अपने आप मानकर न चलें। फिर भी मिश्रित क्रॉलर पर कठोर नियम का बदलाव महत्वपूर्ण है: पुराना “Block AI bots” विकल्प 15 सितंबर को समाप्त होने की दिशा में है और उस विकल्प से जुड़े मिश्रित क्रॉलर का व्यवहार भी बदल सकता है।
यदि खोज पहुँच बनाए रखना जरूरी है, तो समय-सीमा से पहले Security Settings में जाकर आगामी मिश्रित-क्रॉलर परिवर्तन से बाहर रहने का विकल्प दर्ज करें। Search Engine Journal का विश्लेषण भी पुष्टि करता है कि Training अवरोध Googlebot को रोक सकता है और साइट संचालकों को समय-सीमा से पहले सेटिंग की समीक्षा करनी चाहिए।
विन्यास बदलने का सुरक्षित क्रम
- Cloudflare में संबंधित डोमेन खोलें और Security Settings के “Configure AI bot policies” भाग में Search, Agent तथा Training की मौजूदा स्थिति लिख लें। पुराने “Block AI bots” विकल्प और आगामी बदलाव से बाहर रहने की स्थिति भी दर्ज करें।
- किसी सामान्य यातायात अवधि के Cloudflare सुरक्षा आयोजन और मूल सर्वर लॉग सुरक्षित रखें। प्रमुख सार्वजनिक पृष्ठों पर Googlebot के अनुरोध, HTTP स्थिति और मूल सर्वर तक पहुँच को आधाररेखा बनाएं।
- Search को अनुमति दें। Training और Agent के लिए पूरे क्षेत्र, केवल विज्ञापन वाले पृष्ठों या अनुमति में से विकल्प चुनें; मिश्रित क्रॉलर पर Training अवरोध तभी स्वीकार करें जब उसका खोज प्रभाव भी स्वीकार्य हो।
- उसी समय robots.txt, वेब अनुप्रयोग फ़ायरवॉल और मूल सर्वर नियम न बदलें। एक परिवर्तन के बाद परिणाम देखने से अवरोध लगाने वाली परत पहचानना आसान रहेगा।
- मुखपृष्ठ, नई सामग्री, श्रेणी पृष्ठ और आय देने वाले प्रमुख पृष्ठ जाँचें। अपेक्षित परिणाम सत्यापित Googlebot के लिए सफल HTTP प्रतिक्रिया और पूरी प्रस्तुत सामग्री है, न कि 403, चुनौती पृष्ठ या खाली सामग्री।
केवल उपयोगकर्ता-एजेंट में “Googlebot” लिखा होना पहचान का प्रमाण नहीं है। Google की अनुरोध सत्यापन प्रक्रिया एकबारगी जाँच के लिए उलटा और फिर सीधा DNS मिलान तथा बड़े पैमाने पर जाँच के लिए प्रकाशित IP सूचियों से मिलान बताती है।
बदलाव के बाद पहुँच और सूचीकरण दोनों जाँचें
पहले Cloudflare सुरक्षा आयोजनों और मूल सर्वर लॉग की तुलना करें। यदि सत्यापित Googlebot अनुरोध Cloudflare पर रुक रहा है और मूल सर्वर तक नहीं पहुँच रहा, तो robots.txt में Allow लिखना पर्याप्त नहीं होगा; AI नीति या किसी अन्य सुरक्षा नियम में लगा अवरोध हटाना पड़ेगा।
इसके बाद खोज स्थिति अलग से देखें। Google Search Central की समस्या-जाँच सलाह Crawl Stats से उपलब्धता की त्रुटियाँ देखने, कुछ URL को URL Inspection से जाँचने और सर्वर लॉग में Googlebot गतिविधि खोजने को कहती है। वह क्रॉल और सूचीकरण को अलग अवस्थाएँ भी मानती है, इसलिए सफल अनुरोध अपने आप सूचीकरण की गारंटी नहीं है।
- बदलाव से पहले और बाद में Googlebot की सफल प्रतिक्रियाओं, 403 और चुनौती प्रतिक्रियाओं की तुलना करें।
- महत्वपूर्ण URL की HTTP स्थिति और प्रस्तुत सामग्री जाँचें।
- robots.txt में अनचाहा Disallow और पृष्ठ पर अनचाहा noindex निर्देश खोजें।
- Crawl Stats में उपलब्धता चेतावनी या असामान्य गिरावट देखें।
- नई या बदली सामग्री पर URL Inspection से क्रॉल और सूचीकरण की स्थिति अलग-अलग दर्ज करें।
Googlebot रुकने पर तुरंत सभी बॉट को अनुमति न दें। पहले तय करें कि रोक Training नीति, अलग सुरक्षा नियम या मूल सर्वर से आई है; फिर प्रमाणित खोज पहुँच बहाल करते हुए शुद्ध Training और चुने हुए Agent यातायात पर नियंत्रण बनाए रखें।
यह भी पढ़ें:
हमारे न्यूज़लेटर की सदस्यता लें
Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।