← वापस मंद प्रकाश वाले सर्वर रूम के कॉरिडोर में एम्बर रंग की रोशनी दूर के एक आधे खुले दरवाज़े से निकल रही है

क्या आप ClaudeBot और GPTBot को अपनी साइट को क्रॉल करने दें?

पिछले अक्टूबर में एक क्लाइंट ने मुझे कॉल किया, बिल्कुल घबराया हुआ। उसके होस्टिंग डैशबोर्ड में तीन हफ्तों में क्रॉल ट्रैफिक में 34% की स्पाइक दिख रही थी और वह पूरी तरह यकीन था कि उसे स्क्रेपर अटैक का सामना करना पड़ा है। मैंने उसके सर्वर लॉग्स को देखा। कोई स्क्रेपर नहीं। ClaudeBot और GPTBot, उसके 800-पेज WooCommerce कैटलॉग को हर कुछ दिनों में घड़ी की तरह क्रॉल कर रहे थे। उसे इस बात का कोई अंदाज़ा नहीं था कि ये चीजें मौजूद भी हैं।

यह बातचीत अभी हर जगह हो रही है। और जो सलाह लोगों को ऑनलाइन मिल रही है वह सब अलग-अलग है: सब कुछ ब्लॉक करो, सब कुछ अनुमति दो, इससे कोई फर्क नहीं पड़ता, इससे बहुत फर्क पड़ता है। ज्यादातर यह लोगों द्वारा लिखी गई है जिन्होंने महीनों से सर्वर लॉग नहीं देखे हैं।

मैंने देखे हैं। Seahawk Media में बनाई गई 12,000+ साइट्स में, साथ ही मेरे अपने क्लाइंट पोर्टफोलियो में, मेरे पास अब काफी स्पष्ट तस्वीर है कि क्या वास्तव में हो रहा है और विभिन्न प्रकार की साइट्स के लिए सही निर्णय क्या है। मुझे आपको इसके बारे में बताने दीजिए।

ClaudeBot और GPTBot वास्तव में क्या हैं

पहले ज़रा सी जमीनी बात करते हैं, क्योंकि लोग इन्हें मिलाते हैं।

GPTBot OpenAI का क्रॉलर है। इसका उपयोग भविष्य के GPT मॉडल्स के लिए प्रशिक्षण डेटा एकत्र करने के लिए किया जाता है, और यह मध्य-2023 से सक्रिय है। OpenAI ने अपना GPTBot दस्तावेज़ प्रकाशित किया और स्पष्ट रूप से बताया कि इसे ब्लॉक करने से इस बात पर कोई असर नहीं पड़ेगा कि ChatGPT आपकी मौजूदा कंटेंट के बारे में प्रश्नों का उत्तर कैसे देता है, यह विशुद्ध रूप से भविष्य की प्रशिक्षण के लिए है।

ClaudeBot Anthropic का समतुल्य है, जिसका उपयोग Claude मॉडल्स को प्रशिक्षित करने के लिए किया जाता है। समान मूल बात है। यह आपके लॉग्स में ClaudeBot यूजर-एजेंट स्ट्रिंग के साथ दिखाई देता है और अपनी पहचान ईमानदारी से करता है, जिसके लिए मैं उन्हें क्रेडिट दूँगा।

और भी हैं। Google का Google-Extended विशेष रूप से Gemini प्रशिक्षण के लिए है, Googlebot से अलग है। CCBot (Common Crawl) वर्षों से मौजूद है। ByteDance का Bytespider। सूची बढ़ रही है।

लेकिन यह बात है: ये सभी समान रूप से व्यवहार नहीं करते। GPTBot और ClaudeBot आपके robots.txt का सम्मान करते हैं। Bytespider... मेरे अनुभव में, कम विश्वसनीय रूप से।

ब्लॉकिंग मेकेनिज्म: robots.txt और यह वास्तव में क्या करता है

अगर आप GPTBot को ब्लॉक करना चाहते हैं, तो आप अपने robots.txt में यह जोड़ते हैं:

`` User-agent: GPTBot Disallow: / ``

ClaudeBot, Google-Extended, और अन्य के लिए भी यही पैटर्न है। सरल। किसी भी WordPress प्लगइन जैसे Yoast या Rank Math में तीस सेकंड लगते हैं, या आप फाइल को सीधे एडिट करते हैं।

लेकिन इसका वास्तव में मतलब क्या है: यह एक विनम्र अनुरोध है, कोई ताला नहीं। कानूनी और प्रतिष्ठा के मामले में गंभीर कंपनियों (OpenAI, Anthropic, Google) से वैध क्रॉलर इसका सम्मान करते हैं। संदिग्ध स्क्रेपर्स जो प्रतिद्वंद्वी टूल्स बना रहे हैं? वे इसे पूरी तरह नज़रअंदाज़ करते हैं। तो अगर आपकी चिंता खराब अभिनेताओं द्वारा डेटा चोरी को रोकने की है, तो robots.txt आपकी रक्षा की लाइन नहीं है। आप इसके लिए Cloudflare के बॉट प्रबंधन या सर्वर-स्तरीय IP ब्लॉकिंग चाहेंगे।

मैंने साइट मालिकों को दो घंटे robots.txt नियम कॉन्फ़िगर करते देखा है ताकि कोई अनाम AI क्रॉलर ब्लॉक किया जा सके जो बिल्कुल भी ध्यान नहीं देने वाला था। समय की बर्बादी। अपनी ऊर्जा वैध क्रॉलर्स पर केंद्रित करें, क्योंकि वहीं आपके वास्तविक विकल्प हैं।

असली ट्रेड-ऑफ जिसके बारे में कोई बात नहीं करता

ठीक है। यहीं पर ज्यादातर चर्चा विफल होती है।

ब्लॉक करने का तर्क ऐसा है: "वे अपने मॉडल्स को प्रशिक्षित करने के लिए मेरी कंटेंट ले रहे हैं और मुझे कुछ नहीं मिलता।" सही। सच में। अगर आप मूल संपादकीय कंटेंट, एक कानूनी डेटाबेस, गहन ट्यूटोरियल की एक लाइब्रेरी वाले प्रकाशक हैं, तो वह आपकी बौद्धिक संपत्ति है और मूल्य विनिमय सर्वोत्तम पर अस्पष्ट है।

AI उत्तरों में उद्धृत होना नया बैकलिंक है, यह तर्क कुछ इस तरह चलता है: "आप प्रशिक्षण डेटा में होना चाहते हैं।" यह भी काफी उचित है। लेकिन लोग जितना मानते हैं उससे कमजोर है, क्योंकि प्रशिक्षण डेटा और AI उद्धरण के बीच संबंध इतना सीधा नहीं है।

यहाँ मेरा वास्तविक विचार है, एक साल से ज्यादा समय तक क्लाइंट साइटों पर इसे देखने के बाद।

सवाल "सब कुछ ब्लॉक करो या सब कुछ allow करो" नहीं है। यह है "कौन सी सामग्री, किन क्रॉलर के लिए, और मुझे वास्तव में क्या सुरक्षित रखना चाहिए?"

एक SaaS ब्लॉग awareness generate करने के लिए मौजूद है। GPTBot को ब्लॉक करो? तुम एक संभावित distribution channel को बंद कर रहे हो शून्य मूर्त लाभ के लिए। एक paid रेसिपी डेटाबेस या premium research archive? हिसाब पूरी तरह पलट जाता है।

2024 की शुरुआत में मैं एक क्लाइंट के साथ काम कर रहा था जो subscription-based industry report सेवा चलाता है। सभ्य ट्रैफिक, लगभग 40,000 मासिक आगंतुक, अधिकांश paywall के पीछे। वे सभी AI क्रॉलर को allow कर रहे थे क्योंकि "अधिक दृश्यमानता।" मैंने देखा कि बॉट्स के लिए वास्तव में क्या crawlable था और इसमें 18 महीने की पूरी-पाठ premium reports शामिल थीं जिन्हें Google को noindex के लिए बताया गया था। हमने उन निर्देशिकाओं से AI क्रॉलर को ब्लॉक कर दिया। बीस मिनट लगे। सार्वजनिक marketing pages open रहे।

यह वह nuance है जो flat "सब कुछ ब्लॉक करो" या "सब कुछ allow करो" discourse से गायब है।

यह SEO को कैसे प्रभावित करता है (और कैसे नहीं करता है)

मुझे सीधा कहने दो: ClaudeBot और GPTBot को ब्लॉक करने का आपकी Google rankings पर शून्य प्रभाव है। कोई नहीं। Googlebot एक बिल्कुल अलग सिस्टम है। GPTBot और ClaudeBot Google Search में feed नहीं करते। किसी को कुछ और कहने दो मत।

जो इसे संभावित रूप से प्रभावित करता है वह है AI-generated उत्तरों के अंदर आपकी visibility। ChatGPT, Claude, Perplexity। Perplexity विशेष रूप से live web retrieval करता है, इसलिए यह प्रशिक्षण डेटा से एक भिन्न mechanism है।

उभरता AEO कोण

Answer Engine Optimisation एक वास्तविक चीज है जिसे लोग अब track कर रहे हैं। AI प्रतिक्रियाओं में source के रूप में उद्धृत होना 18 महीने पहले की तुलना में ज्यादा मायने रखता है, हालांकि इसे साफ-साफ मापना अभी भी मुश्किल है। सिद्धांत यह है कि प्रशिक्षण डेटा में सामग्री मॉडल को आपके ब्रैंड या साइट से परिचित होने में मदद करती है, जो समय के साथ उद्धरण को प्रभावित कर सकता है। यह प्रशंसनीय है। यह सिद्ध नहीं है।

मैं विशुद्ध रूप से इस अनुमान के आधार पर blocking निर्णय नहीं लूंगा। इसे अपनी सामग्री की प्रकृति और commercial sensitivity के आधार पर करो।

Server Load: छोटे Hosts के लिए एक वैध चिंता

यह वह बोझ भरा व्यावहारिक है जिसे philosophy debates में अनदेखा किया जाता है।

ClaudeBot और GPTBot उन साइटों पर आक्रामक क्रॉलर हो सकते हैं जिन्हें वे दिलचस्प पाते हैं। वह 800-पृष्ठ WooCommerce क्लाइंट जिसका मैंने जिक्र किया? उसकी shared hosting को वास्तव में इसका सामना करना पड़ रहा था। हम उसे Cloudflare के bot fight mode के माध्यम से crawl rate limit में ले गए, बजाय सीधे ब्लॉक करने के, जिसने इसे पूरी तरह smooth कर दिया बिना उन्हें पूरी तरह काट दिए।

अगर आप एक सस्ते shared host पर एक बड़ी साइट के साथ हैं, तो अपने लॉग check करो। वास्तव में देखो। आप यह cPanel में "Raw Access" के तहत कर सकते हो या GoAccess जैसे tool के माध्यम से, जो free है और access logs को तेजी से parse करने के लिए शानदार है। अगर AI क्रॉलर top 10 requesters में दिख रहे हैं और आप limited resources पर हैं, तो यह एक वास्तविक conversation है।

एक VPS या dedicated server पर sensible specs के साथ? शायद कोई समस्या नहीं। लेकिन मत मानो।

Platform-Specific Notes

WordPress साइटें

Yoast SEO और Rank Math दोनों तुम्हें files को directly touch किए बिना robots.txt को edit करने देते हैं। SEO > Tools > File Editor के तहत Yoast का interface इसके लिए ठीक है। Rank Math के पास General Settings > Edit robots.txt के तहत समान path है।

अगर तुम अधिक granular control चाहते हो, तो Yoast Premium में Crawl Optimization settings सामान्य रूप से unnecessary crawl surface को कम करते हैं, जो सभी bots में मदद करता है।

Shopify और Hosted Platforms

Shopify auto-generate करता है तुम्हारा robots.txt.liquid और इसे कुछ AI crawler rules को शामिल करने के लिए अपडेट किया गया है, लेकिन तुम्हारे पास limited control है। एक robots.txt.liquid customisation path 2021 से उपलब्ध है, लेकिन इसमें theme editing की आवश्यकता है। हमेशा स्पष्ट नहीं।

Static Sites (Gatsby, Astro, Next.js)

पूरा नियंत्रण। बस अपनी robots.txt को अपनी public directory में एक static file के रूप में रखें और बस। इसे intentionally configure न करने का कोई बहाना नहीं है।

मेरा वर्तमान सिफारिश ढांचा

विभिन्न साइटों को विभिन्न defaults की आवश्यकता होती है। मैं अब इसके बारे में इसी तरह सोचता हूँ:

Default में allow करें यदि:

  1. आपकी content मुख्य रूप से marketing, शैक्षणिक, या awareness-focused है और कोई paywalled value नहीं है।
  2. आप एक छोटा business हैं जो जहाँ भी संभव हो brand presence बढ़ाने की कोशिश कर रहे हैं।
  3. आप freely available information publish करते हैं और व्यापक distribution से genuinely लाभान्वित होंगे।
  4. आपके पास एक nuanced blocking strategy को maintain करने के लिए technical resources नहीं हैं।

Block या restrict करें यदि:

  1. आपके पास premium paywalled content है जो technically crawlable है (common oversight)।
  2. आप एक publisher, news organisation, या database चलाते हैं जहाँ content ही product है।
  3. Crawlers से server load limited hosting पर measurably performance को प्रभावित कर रहा है।
  4. आपके पास data collection को restrict करने के लिए legal कारण हैं (regulated contexts में medical, legal, financial content)।

विचार करने योग्य Middle path:

  • High-value content directories से AI training crawlers को block करें, blog/marketing sections पर allow करें।
  • यदि load एक concern है तो full blocks की जगह Cloudflare rate limiting का उपयोग करें।
  • हर quarter फिर से देखें। यह तेजी से बदल रहा है और आज जो sense बनता है वह shift हो सकता है।

अभी check करने का तरीका कि क्या वे आपको crawl कर रहे हैं

अनुमान न लगाएँ। देखें।

  • Cloudflare Analytics (free tier) bot traffic categories दिखाता है और आप user-agent के अनुसार filter कर सकते हैं।
  • आपकी raw access logs के विरुद्ध GoAccess run करना बिल्कुल कौन से bots किस चीज़ को hit कर रहे हैं यह देखने का fastest तरीका है।
  • Google Search Console आपको AI crawler data नहीं दिखाएगा, लेकिन यह आपको comparison के लिए एक crawl baseline देता है।
  • अपनी access.log file में "GPTBot" या "ClaudeBot" को सीधे search करें: grep -i "GPTBot" /var/log/nginx/access.log | wc -l एक दिए गए log file में कितने requests हैं यह quickly बताएगा।

Seahawk के पास इस साल की शुरुआत में एक project था जहाँ client को पूरा यकीन था कि AI crawlers उनके performance issues का स्रोत थे। Log analysis चलाया। GPTBot ने 30 दिनों में 47 requests बनाए थे। पूरी तरह irrelevant। वास्तविक culprit एक misconfigured backup plugin था जो हर 6 घंटे full site scans चला रहा था। Bot discourse को आपको अपने actual logs से distract न होने दें।

FAQ

क्या GPTBot को ब्लॉक करने से मेरी ChatGPT visibility को नुकसान होता है?

पहले से इंडेक्स की गई और ट्रेनिंग डेटा में शामिल कंटेंट के लिए नहीं। GPTBot को अभी ब्लॉक करने से सिर्फ भविष्य की ट्रेनिंग रन प्रभावित होती है। ChatGPT का मौजूदा ज्ञान नहीं बदलेगा क्योंकि आपने आज robots.txt रूल जोड़ा। और ChatGPT का ब्राउजिंग प्लगइन वैसे भी लाइव वेब रिट्रीवल करता है, जो अलग तंत्र से नियंत्रित होता है।

अगर मैं ClaudeBot को अनुमति दूँ, तो क्या Anthropic मेरी साइट को क्रेडिट देगा?

स्वचालित रूप से नहीं। ट्रेनिंग डेटा की खपत के साथ कोई एट्रिब्यूशन नहीं आता। अगर Claude किसी जवाब में आपकी साइट को साइट करता है, तो वह इस बात पर आधारित है कि यह कैसे ट्रेन किया गया था और यह रीयल-टाइम में क्या रिट्रीव करता है—क्रॉलर को अनुमति देने का सीधा अनुबंध परिणाम नहीं।

क्या मैं AI क्रॉलर्स से सिर्फ विशिष्ट डायरेक्टरीज को ब्लॉक कर सकता हूँ?

हाँ, बिल्कुल। आपका robots.txt जितना चाहें उतना ग्रैन्युलर हो सकता है। GPTBot के लिए Disallow: /premium/ करते हुए /blog/ को खुला रखना बिल्कुल वैध सिंटैक्स है। यह वह है जो मैं ज्यादातर कंटेंट बिजनेस के लिए वास्तव में सुझाऊँगा।

क्या मेरी कंटेंट पर AI कंपनियों को ट्रेनिंग न देने की माँग करने का कोई कानूनी आधार है?

यह वास्तव में अनिर्णीत क्षेत्र है। The New York Times lawsuit against OpenAI सबसे प्रमुख केस है जो इसे तय करने का रास्ता खोल रहा है। अभी के लिए, robots.txt व्यावहारिक तंत्र है जो उपलब्ध है। कानूनी ढाँचे तकनीक से साल भर पीछे हैं।

क्या सभी AI क्रॉलर्स robots.txt को मानते हैं?

अच्छी फंडिंग और प्रतिष्ठा वाली कंपनियों के प्रमुख क्रॉलर्स (OpenAI, Anthropic, Google) आम तौर पर मानते हैं। छोटे, कम जवाबदेह स्क्रेपर्स अक्सर नहीं मानते। robots.txt एक gentleman's agreement है, तकनीकी बाधा नहीं।

---

देखिए, यहाँ कोई सार्वभौमिक सही जवाब नहीं है। मैंने कुछ क्लाइंट्स के लिए AI क्रॉलर्स को ब्लॉक किया है और दूसरों के लिए स्पष्ट रूप से दरवाजे खोले हैं, कभी-कभी एक ही दिन। यह निर्णय आपकी कंटेंट स्ट्रैटेजी और आपके होस्टिंग सेटअप के साथ एक ही बातचीत का हिस्सा होना चाहिए—किसी ब्लैंकेट पॉलिसी में नहीं जो पिछले हफ्ते Twitter पर जो पढ़ा आपने उस पर आधारित है।

अपने लॉग्स देखें। जानें कि आपको कौन क्रॉल कर रहा है। फिर एक जानबूझकर का फैसला लें, न कि किसी डिफॉल्ट को विरासत में लें जो आपने कभी सेट नहीं किया।

← वापस