← वापस बारिश से भीगी लंदन की कार्यालय खिड़की, शाम के समय, हाथ से लिखे गए नोट्स वाली नोटबुक और डेस्क पर ठंडी चाय, सिनेमाई संपादकीय मूड

क्रॉल किया गया, वर्तमान में इंडेक्स नहीं: मैं इसे कैसे ठीक करता हूँ

2021 में, Manchester के एक स्थानीय सॉलिसिटर फर्म ने Seahawk के पास आया क्योंकि उनका ब्लॉग चार महीने तक Search Console में निष्क्रिय पड़ा था। तेतालीस पोस्ट। शून्य इंडेक्स किए गए। हर एक "क्रॉल किया गया, वर्तमान में इंडेक्स नहीं" दिखा रहा था। उनकी पिछली एजेंसी ने कंधे उचका दिए थे और उन्हें कहा था कि Google "बस धीमा था।" मैंने एक दोपहर में साइट खोली और नब्बे मिनट में मूल कारण निकाल दिया। पतली सामग्री, प्रैक्टिस एरिया पेजों पर डुप्लिकेट मेटा विवरण जो ब्लॉग क्रॉल बजट में फैल रहे थे, और एक गलत तरीके से कॉन्फ़िगर किए गए Yoast साइटमैप जो noindexed कैटेगरी आर्काइव्स की ओर इशारा कर रहा था।

वह वाक्य, "क्रॉल किया गया, वर्तमान में इंडेक्स नहीं," Google Search Console द्वारा दिखाई जाने वाली सबसे निराशाजनक स्थितियों में से एक है। इसका मतलब है कि Google ने पेज को खोजा। इसने इसे डाउनलोड करने के लिए संसाधन खर्च किए। और फिर उसने देखा कि वहाँ क्या है और कहा: यह इसके लायक नहीं है। यह समझना कि Google यह निर्णय क्यों लेता है, और इसे व्यवस्थित रूप से ठीक करना, कुछ ऐसा है जो मुझे 12,000+ साइट्स पर बहुत अच्छा होना पड़ा है।

---

"क्रॉल किया गया, वर्तमान में इंडेक्स नहीं" का वास्तविक अर्थ क्या है

एक आम गलतफहमी है कि यह स्थिति मतलब है कि Google ने अभी तक इंडेक्स करने के लिए दौर नहीं लगाया है। वह इसका मतलब नहीं है। Google ने URL को क्रॉल किया है। इसने इसे इंडेक्स में शामिल न करने का सचेत विकल्प बनाया है। यह एक पूरी तरह से अलग समस्या है, और इसके लिए एक अलग प्रतिक्रिया की आवश्यकता है।

दो व्यापक कारण गुणवत्ता सिग्नल और तकनीकी सिग्नल हैं। गुणवत्ता सिग्नल: Google को नहीं लगता कि पेज उपयोगकर्ताओं को पर्याप्त मूल्य जोड़ता है। तकनीकी सिग्नल: आपके सेटअप में कुछ Googlebot को भ्रमित कर रहा है या आपके इरादे का विरोध कर रहा है। दोनों ठीक किए जा सकते हैं। न ही खुद को ठीक करता है।

Google के अपने दस्तावेज़ को पढ़ना लायक है कि कैसे Google Search काम करता है यदि आप क्रॉल से इंडेक्स तक की पाइपलाइन को समझना चाहते हैं। यह शुष्क लेकिन उपयोगी है।

---

चरण एक: Search Console में संपूर्ण चित्र खींचें

अनुमान न लगाएँ। Google Search Console खोलें और Pages (पहले Coverage) पर जाएँ। "क्रॉल किया गया, वर्तमान में इंडेक्स नहीं" के लिए फ़िल्टर करें। सूची निर्यात करें। आप केवल नमूना नहीं बल्कि पूर्ण URL सेट चाहते हैं।

मैं फिर उस सूची को एक ही साइट के Screaming Frog क्रॉल के विरुद्ध क्रॉस-संदर्भ करता हूँ। हर बार। Screaming Frog आपको पेज की शब्द गणना (कस्टम एक्सट्रैक्शन या बिल्ट-इन पठनीयता मेट्रिक्स के माध्यम से), चाहे यह XML साइटमैप में हो, इसके canonical टैग स्थिति, इसके meta robots निर्देश, पेज के लिए आंतरिक लिंक गणना, और प्रतिक्रिया कोड बताएगा। वह संयोजन आपको अधिकांश जानकारी देता है।

मैं पहले क्या ढूंढ रहा हूँ

  • 300 से कम शब्दों की बॉडी कॉपी वाले पेज
  • अन्य इंडेक्स किए गए पेजों के समान या लगभग समान मेटा विवरण वाले पेज
  • XML साइटमैप में शामिल नहीं किए गए पेज
  • शून्य आंतरिक लिंक प्राप्त करने वाले पेज
  • क्रॉल किए जाने वाले अनाथ पेजिनेशन URL या पतली आर्काइव पेज

Manchester के सॉलिसिटर मामले में, ब्लॉग पोस्ट औसतन 180 शब्द थे। यह मुख्य समस्या थी। बाकी सब कुछ माध्यमिक था।

---

गुणवत्ता समस्या: Google सोचता है कि आपका पेज काफी अच्छा नहीं है

यह सुनने के लिए असहज है लेकिन यह सबसे आम कारण है जो मैं देखता हूँ। Google की गुणवत्ता सीमा 2022 के बाद से काफी हद तक आगे बढ़ी है। पेज जो तीन साल पहले सूचकांक में चुप-चाप बैठे रहते थे अब सक्रिय रूप से बाहर निकाले जा रहे हैं।

पतली सामग्री

अगर किसी पेज में 400-500 शब्द से कम हैं और उसमें मजबूत E-E-A-T संकेत नहीं हैं (लेखक का परिचय, उद्धरण, मूल अंतर्दृष्टि), तो Google अक्सर इसे क्रॉल करेगा और पार्क कर देगा। मैंने यह विशेष रूप से देखा है:

  • WooCommerce प्रोडक्ट पेज जिनमें निर्माता की कॉपी ज्यों की त्यों चिपकाई हुई है
  • रियल एस्टेट लिस्टिंग पेज जिनमें दो पंक्तियों की संपत्ति विवरण है
  • टेम्पलेट से बने लोकेशन पेज जिनमें केवल शहर का नाम बदला गया है
  • पुराने FAQ पेज जो एक सवाल का एक पैराग्राफ में जवाब देते हैं

समाधान केवल शब्द जोड़ना नहीं है। फिलर जोड़ने से स्थिति और खराब हो जाती है। समाधान है उपयोगी और विशिष्ट जानकारी जोड़ना जो कोई इंसान वास्तव में पढ़ना चाहे। वकीलों के लिए, मैंने उनके ब्लॉग पोस्ट को फिर से लिखा और इसमें वास्तविक केस आउटकम (गुमनाम), विशिष्ट यूके कानून संदर्भ, और कार्य उदाहरण शामिल किए। शब्द संख्या 180 से 900 तक गई। आठ हफ्ते बाद, 43 में से 31 पोस्ट इंडेक्स हो गए।

डुप्लिकेट और निकट-डुप्लिकेट कंटेंट

Screaming Frog की डुप्लिकेट कंटेंट रिपोर्ट आपका दोस्त है। लेकिन अगर आप क्रॉस-साइट डुप्लिकेशन के बारे में चिंतित हैं तो URL को Copyscape या Siteliner में भी चलाएँ। मेरे पास ई-कॉमर्स क्षेत्र के क्लाइंट हैं जहाँ उनका सप्लायर 40 अन्य रिटेलर्स को एक जैसी प्रोडक्ट विवरण प्रदान कर रहा था। Google एक को इंडेक्स करता है और बाकी को नजरअंदाज करता है। यह कोई बग नहीं है, यह जैसा होना चाहिए वैसा ही काम कर रहा है।

आंतरिक निकट-डुप्लिकेशन अधिक चालाक है। अगर आपके पास "Leeds में प्लंबर," "Sheffield में प्लंबर," "Bradford में प्लंबर" जैसे सर्विस पेज हैं, और वे शहर के नाम को छोड़कर 95% समान हैं, तो Google एक को चुनेगा और बाकी को दबा देगा। मैंने यह पैटर्न पूरे फेसेटेड सर्च सिस्टम को "क्रॉल किया गया, वर्तमान में इंडेक्स नहीं" नरक में गिरते हुए देखा है।

---

तकनीकी समस्या: आपका सेटअप कुछ मिश्रित संकेत भेज रहा है

कभी-कभी कंटेंट वास्तव में अच्छा होता है और Google फिर भी इंडेक्स करने से इनकार करता है। यह वह जगह है जहाँ आप तकनीकी संकेतों में खोदते हैं।

कैनोनिकल टैग भ्रम

यह पहला तकनीकी अपराधी है जो मुझे मिलता है। एक पेज को खुद पर कैनोनिकलाइज किया जाता है (सही है), लेकिन कहीं ऊपर की ओर, एक कैटेगरी पेज या पेजिनेटेड URL के पास एक कैनोनिकल है जो उस पेज को इंगित कर रहा है जो आप इंडेक्स करना चाहते हैं। Google कभी-कभी इसे एक संकेत के रूप में व्याख्या करता है कि कैनोनिकल स्रोत एक डुप्लिकेट है। मैंने WordPress थीम्स को ऐसे तरीके से यह स्वचालित रूप से करते हुए देखा है जो क्रॉल के बिना वास्तव में पकड़ना मुश्किल हैं।

जाँच करें: क्या आपकी "क्रॉल किया गया, वर्तमान में इंडेक्स नहीं" सूची के हर पेज के पास एक स्व-संदर्भित कैनोनिकल है? क्या साइट पर कुछ और अप्रत्याशित रूप से इन URL पर कैनोनिकल इंगित कर रहा है?

XML साइटमैप समस्याएँ

आपका साइटमैप केवल उन URL को सूचीबद्ध करना चाहिए जिन्हें आप सक्रिय रूप से इंडेक्स करना चाहते हैं। वह स्पष्ट लगता है। व्यवहार में, Yoast, Rank Math, और अधिकांश अन्य SEO प्लगइन खुशी से आपके साइटमैप में noindexed पेज, पेजिनेटेड URL, और टैग आर्काइव शामिल करेंगे अगर आप सावधान नहीं हैं। Google को आपके साइटमैप में एक URL दिखता है, वह इसे क्रॉल करता है, एक noindex या पतली कंटेंट पाता है, और यह एक बर्बाद क्रॉल क्रेडिट है, साथ ही एक विश्वास संकेत है कि आप वास्तव में अपनी साइट के साथ क्या कर रहे हैं इसे नहीं समझते।

मैं एक सरल प्रक्रिया के साथ साइटमैप ऑडिट करता हूँ:

  1. साइटमैप XML डाउनलोड करें
  2. हर URL को एक स्प्रेडशीट में आयात करें
  3. हर URL को Screaming Frog के माध्यम से चलाएँ (या बल्क एक्सपोर्ट का उपयोग करें)
  4. किसी भी URL को फ्लैग करें जो noindexed है, रीडायरेक्ट करता है, या गैर-200 स्थिति देता है
  5. उन URL को साइटमैप से हटा दें

यह अकेले ही पिछले साल तीन क्लाइंटों के लिए "क्रॉल किया गया, वर्तमान में इंडेक्स नहीं" स्थिति साफ़ कर दी है। कंटेंट को बिल्कुल छुए बिना।

आंतरिक लिंकिंग अंतराल

PageRank (हाँ, अभी भी प्रासंगिक है, हाँ, 2024 में भी) आंतरिक लिंक के माध्यम से प्रवाहित होता है। एक पृष्ठ जिसमें शून्य आंतरिक लिंक उसकी ओर इशारा करते हैं, सत्ता के संदर्भ में Googlebot के लिए प्रभावी रूप से अदृश्य है। Google इसे साइटमैप के माध्यम से क्रॉल कर सकता है और फिर यह तय कर सकता है कि यह अनुक्रमण के लिए काफी महत्वपूर्ण नहीं है क्योंकि साइट पर कुछ भी इसकी ओर इशारा नहीं कर रहा है।

अनाथ पृष्ठ सामान्य हैं। मैं उन्हें खोजने के लिए Screaming Frog की "Orphan URLs" रिपोर्ट (Site Structure के अंतर्गत) का उपयोग करता हूँ। हर उस पृष्ठ के लिए तीन से पाँच प्रासंगिक आंतरिक लिंक जोड़ें जो "indexed नहीं" बकेट में बैठा है और आप अक्सर चार से छह सप्ताह के भीतर गति देख सकते हैं।

---

क्रॉल बजट: जब यह वास्तविकता में एक क्षमता समस्या हो

छोटी साइटों के लिए (1,000 पृष्ठों से कम), क्रॉल बजट लगभग कभी वास्तविक समस्या नहीं होता है। मैं जानता हूँ कि लोग इस व्याख्या के चारों ओर बहुत कुछ फेंकते हैं। लेकिन बड़ी ई-कॉमर्स साइटों के लिए (हमारे पास Seahawk में 80,000 SKU वाले एक फैशन खुदरा विक्रेता के साथ), यह वास्तव में मायने रखता है।

यदि Googlebot अपनी यात्राओं को आपके अनंत फेसेट किए गए नेविगेशन, आपके सेशन ID पैरामीटर, या आपके आंतरिक खोज परिणाम पृष्ठों को क्रॉल करने में व्यतीत कर रहा है, तो यह उन उत्पाद पृष्ठों तक नहीं जा रहा है जो वास्तव में महत्वपूर्ण हैं। क्रॉल बजट पर Google दस्तावेज़ कुछ आधिकारिक SEO मार्गदर्शन में से एक है जिसे मैं वास्तव में शुरुआत से अंत तक पढ़ने की सिफारिश करूँगा।

समाधान: URL पैरामीटर टूल (यदि आप अभी भी पुराने Search Console का उपयोग कर रहे हैं) के माध्यम से या Googlebot के लिए robots.txt के माध्यम से निकट-डुप्लिकेट पृष्ठ उत्पन्न करने वाले URL पैरामीटर को ब्लॉक करें, और सुनिश्चित करें कि आपके आंतरिक खोज पृष्ठ noindexed हैं। यह महत्वपूर्ण पृष्ठों के लिए क्रॉल क्षमता को मुक्त करता है।

---

अनुक्रमण का अनुरोध: इसका उपयोग कब करें और कब नहीं

Search Console में "Request Indexing" बटन परिवर्तन के बाद उच्च-प्राथमिकता वाले व्यक्तिगत URLs के लिए उपयोगी है। यह अंतर्निहित कारण को ठीक करने का एक विकल्प नहीं है। मैं फ्रीलांसरों को उन पृष्ठों पर उस बटन को आवेग से दबाते हुए देखता हूँ जिन्हें वे छुए नहीं हैं। यह अपने आप में कुछ नहीं करता है।

मेरा नियम: पहले ठीक करें, दूसरा अनुरोध करें। सामग्री, canonical tags, या आंतरिक लिंकिंग में पदार्थपूर्ण परिवर्तन करने के बाद, URL Inspection tool के माध्यम से URL सबमिट करें। इसे दो से चार सप्ताह दें। यदि यह उसके बाद भी अनुक्रमित नहीं है, तो अंतर्निहित समस्या अभी तक ठीक नहीं हुई है।

एक और बात: request indexing कोटा सीमित है। उन पृष्ठों पर इसे बर्बाद न करें जिनमें अभी भी पतली सामग्री या टूटे हुए canonical सेटअप हैं। आप बस Google को अपने अपने निर्णय की पुष्टि करने के लिए कह रहे हैं।

---

इसे साफ करने में कितना समय लगता है?

ईमानदारी से कहूँ तो, यह अधिकांश SEO गाइड स्वीकार करने की तुलना में अधिक भिन्न होता है। मैंने पृष्ठों को "Crawled, currently not indexed" से सामग्री अद्यतन के पाँच दिनों के भीतर अनुक्रमित में फ्लिप किया है। मैंने दूसरों को बारह सप्ताह लगते देखे हैं। सबसे अधिक महत्वपूर्ण प्रतीत होने वाले कारक ये हैं:

  • कुल मिलाकर डोमेन में कितना अधिकार है (पुरानी, जुड़ी हुई साइटों को तेजी से पुनर्विचार दिखाई देता है)
  • यह तय करना कि क्या सुधार सामग्री-संबंधित था (धीमा) या तकनीकी (तेज़)
  • Googlebot साइट को कितनी बार देखता है (Search Console में Crawl Stats रिपोर्ट देखें)

एक ट्रैकिंग स्प्रेडशीट सेट करें। परिवर्तन करने की तारीख नोट करें। हर दो सप्ताह में Search Console में वापस जाँच करें। यदि सप्ताह एक में कुछ नहीं चलता है तो घबराएँ नहीं।

---

FAQ

Google एक पृष्ठ को क्रॉल क्यों करता है लेकिन फिर इसे अनुक्रमित नहीं करता है?

क्रॉलिंग और अनुक्रमण Google की पाइपलाइन में अलग चरण हैं। क्रॉलिंग का मतलब सिर्फ यह है कि Googlebot ने पृष्ठ को डाउनलोड किया। अनुक्रमण का मतलब है Google यह तय करता है कि यह खोज परिणामों में दिखाने के लायक है। यह अंतर तब होता है जब Google की गुणवत्ता मूल्यांकन यह निर्धारित करती है कि पृष्ठ पर्याप्त मूल्य नहीं जोड़ता है, अनुक्रमणिका में मौजूदा सामग्री को डुप्लिकेट करता है, या noindex tag जैसे विरोधाभासी संकेत होते हैं।

Search Console में URL सबमिट करना अनुक्रमण की गारंटी देता है?

नहीं। यह URL को समीक्षा के लिए एक प्राथमिकता कतार में रखता है लेकिन Google अभी भी अपना स्वयं का गुणवत्ता निर्णय लेता है। यदि पृष्ठ में पतली सामग्री या तकनीकी समस्याएँ हैं, तो इसे सबमिट करना सिर्फ Google की पुष्टि में तेजी लाता है कि यह इसे अनुक्रमित नहीं करेगा।

क्या एक पृष्ठ को इस स्थिति में लंबे समय तक फँसने के बाद अनुक्रमित किया जा सकता है?

हाँ, बिल्कुल। मैंने URLs को साफ किया है जो एक साल से अधिक समय के लिए "Crawled, currently not indexed" में बैठे थे, एक बार सामग्री को ठीक से सुधारने के बाद। Google पुनर्मूल्यांकन करता है। यह एक स्थायी ब्लैकलिस्ट नहीं है। यह कहा जा रहा है, यदि एक पृष्ठ छह महीने से अधिक समय के लिए इस स्थिति में है, तो यह ईमानदारी से पूछने के लायक है कि क्या इसे अनुक्रमित किया जाना चाहिए।

क्या यह स्थिति "Discovered, currently not indexed" के जैसी है?

नहीं, और भेद मायने रखता है। "Discovered, currently not indexed" का मतलब है Google जानता है कि URL मौजूद है लेकिन इसे अभी क्रॉल नहीं किया गया है। यह अक्सर एक क्रॉल बजट या आंतरिक लिंक समस्या है। "Crawled, currently not indexed" का मतलब है कि यह पहले से ही मूल्यांकन किया जा चुका है और अलग रखा गया है। दोनों को ध्यान देने की आवश्यकता है लेकिन सुधार थोड़े अलग हैं।

---

"Crawled, currently not indexed" के लिए कोई जादुई समाधान नहीं है। मेरे अनुभव में, यह लगभग हमेशा कंटेंट की गुणवत्ता का मुद्दा या तकनीकी संकेत की समस्या होती है, और आमतौर पर दोनों का संयोजन होता है। डेटा के साथ शुरुआत करें, जो पाएं उसे ठीक करें, और इसे समय दें। Google आपको दंडित करने की कोशिश नहीं कर रहा है। उसे सिर्फ पेज की परवाह करने का एक कारण चाहिए। उसे एक दें।

← वापस