Skip to main content

AI क्रॉलर की पहुँच का ऑडिट कैसे करें

जाँचें कि GPTBot, OAI-SearchBot, ClaudeBot और PerplexityBot आपकी साइट से पेज फ़ेच कर सकते हैं या नहीं, रुकावटों की वजह पहचानें और हर सुधार को सुरक्षित तरीके से सत्यापित करें।

त्वरित जवाब

AI क्रॉलर की पहुँच का ऑडिट करने के लिए robots.txt जाँचें, हर आधिकारिक यूज़र एजेंट से महत्वपूर्ण URLs फ़ेच करके देखें, मिले स्टेटस और HTML की तुलना सामान्य ब्राउज़र अनुरोध से करें, और ब्लॉक किए गए अनुरोधों के लिए CDN या फ़ायरवॉल लॉग देखें। अगर सर्वर चैलेंज, 403, ऐप का खाली ढाँचा या अलग कॉन्टेंट भेज रहा है, तो robots.txt में Allow नियम होना पर्याप्त नहीं है।

12 मिनट पढ़ेंअपडेट किया गया: 2026-09-22

मुख्य बातें

  • जानकारी खोजने और फ़ेच करने वाले क्रॉलर की जाँच ट्रेनिंग क्रॉलर से अलग करें, क्योंकि उनकी भूमिकाएँ और नियंत्रण अलग होते हैं।
  • सिर्फ़ robots.txt या HTTP स्टेटस नहीं, अंतिम रिस्पॉन्स की बॉडी भी जाँचें।
  • हर प्रमुख तरह के पेज का नमूना लेकर ऑडिट करें: होमपेज, लेख, प्रोडक्ट, डॉक्यूमेंटेशन और साइट के अंदरूनी स्तर का एक URL।
  • कॉन्टेंट दोबारा लिखने से पहले CDN और फ़ायरवॉल के नियम ठीक करें; जिन पेजों तक क्रॉलर पहुँच ही नहीं सकते, उन्हें स्रोत के रूप में उद्धृत नहीं किया जा सकता।
  • डिप्लॉयमेंट के बाद जाँच दोहराएँ और क्रॉलर की वास्तविक विज़िट देखने के लिए सर्वर लॉग पर नज़र रखें।

AI क्रॉलर की पहुँच के ऑडिट में क्या जाँचना चाहिए?

पहुँच के पूरे ऑडिट में क्रम से चार स्तर जाँचे जाते हैं: robots.txt में घोषित अनुमति, CDN या फ़ायरवॉल से होकर नेटवर्क पहुँच, रीडायरेक्ट के बाद मिलने वाला अंतिम HTTP रिस्पॉन्स, और ब्राउज़र में JavaScript चलाए बिना उपलब्ध उपयोगी HTML। एक स्तर पर जाँच सफल होने से यह साबित नहीं होता कि अगला स्तर भी ठीक काम कर रहा है।

स्तरजाँच सफल होने की शर्तआम समस्या
robots.txtसंबंधित यूज़र एजेंट के लिए क्रॉल करने पर रोक न होवाइल्डकार्ड नियम, अनुमति देने के लिए बनाए गए नियम पर हावी हो जाता है
नेटवर्क एजबॉट भी उसी ओरिजिन सर्वर तक पहुँच सके जिस तक विज़िटर पहुँचता हैबॉट सुरक्षा 403, 429 या कोई चैलेंज भेजती है
HTTPउचित रीडायरेक्ट के बाद कैनॉनिकल पेज से एक अंतिम 200 रिस्पॉन्स मिलेरीडायरेक्ट लूप, सॉफ़्ट 404 या भाषा/क्षेत्र चयन में फँस जाना
रेंडर किया गया कॉन्टेंटशुरुआती HTML में शीर्षक, उत्तर, लिंक और स्ट्रक्चर्ड डेटा मौजूद होंऐप का खाली ढाँचा कॉन्टेंट दिखाने के लिए क्लाइंट-साइड JavaScript पर निर्भर रहता है

किन क्रॉलर की अलग-अलग जाँच ज़रूरी है?

सभी AI यूज़र एजेंट को एक जैसा न मानें। सर्च के लिए जानकारी जुटाने, यूज़र के अनुरोध पर पेज फ़ेच करने और मॉडल ट्रेनिंग के लिए अलग-अलग क्रॉलर और नियंत्रण हो सकते हैं। पहले उद्देश्य के आधार पर अपनी नीति तय करें, फिर हर प्रदाता के डॉक्यूमेंटेशन में दिए गए सटीक आधिकारिक यूज़र-एजेंट टोकन से जाँच करें।

  • OpenAI: सर्च में पेज खोजने के लिए OAI-SearchBot, यूज़र के अनुरोध पर जानकारी फ़ेच करने के लिए ChatGPT-User, और अपनी ट्रेनिंग नीति के अनुसार GPTBot की जाँच करें।
  • Anthropic: ClaudeBot और मौजूदा डॉक्यूमेंटेशन में बताए गए जानकारी फ़ेच करने वाले एजेंट की अलग-अलग समीक्षा करें।
  • Perplexity: मौजूदा डॉक्यूमेंटेशन के अनुसार PerplexityBot और यूज़र के अनुरोध पर जानकारी फ़ेच करने की पहुँच जाँचें।
  • Google: Googlebot की सर्च पहुँच को जनरेटिव ट्रेनिंग और ग्राउंडिंग के लिए दिए गए Google-Extended नियंत्रणों से अलग समझें।
क्रॉलर के नाम और नीतियाँ बदलते रहते हैं। हर प्रदाता के मौजूदा डॉक्यूमेंटेशन को प्रामाणिक स्रोत मानें और अपने ऑडिट नोट्स में तारीख दर्ज करें।

क्रॉलर की ऐसी जाँच कैसे करें जिसे उसी तरह दोहराया जा सके?

  1. अलग-अलग तरह के पेजों का प्रतिनिधित्व करने वाले पाँच URLs चुनें। इनमें साइट के अंदरूनी स्तर का ऐसा पेज भी रखें जिसका लिंक होमपेज पर न हो।
  2. robots.txt फ़ेच करें और हर यूज़र एजेंट पर लागू होने वाला नियम दर्ज करें।
  3. आधिकारिक यूज़र-एजेंट स्ट्रिंग के साथ हर URL पर अनुरोध भेजें और स्टेटस, अंतिम URL, कॉन्टेंट टाइप, रिस्पॉन्स का आकार और रिस्पॉन्स मिलने में लगा समय दर्ज करें।
  4. मिले हुए HTML में कैनॉनिकल, H1, सीधा उत्तर, मुख्य लिंक और JSON-LD की जाँच करें।
  5. बॉट को मिले रिस्पॉन्स की तुलना सामान्य ब्राउज़र को मिले रिस्पॉन्स से करें और महत्वपूर्ण अंतरों की वजह पता लगाएँ।
  6. चैलेंज, रेट लिमिट और बार-बार विफल होने वाले अनुरोधों के लिए एज और ओरिजिन लॉग जाँचें।
curl -L -A 'OAI-SearchBot' -D headers.txt https://example.com/ -o page.html
grep -Ei '<title|<h1|application/ld\+json|rel="canonical"' page.html

क्रॉलर का अनुरोध विफल होने की वजह कैसे पता लगाएँ?

मिला हुआ परिणामसंभावित वजहअगली जाँच
403 या चैलेंज पेजCDN, WAF या बॉट-मैनेजमेंट का नियमसंबंधित एज इवेंट और नियम का ID देखें
429ऑटोमेटेड ट्रैफ़िक पर साझा रेट लिमिटबॉट के लिए तय सीमाएँ और दोबारा अनुरोध भेजने के दिशानिर्देश देखें
200 के साथ बहुत छोटा HTMLसिर्फ़ क्लाइंट-साइड रेंडरिंग या डेटा अनुरोध ब्लॉक होनाशुरुआती सोर्स और सर्वर लॉग देखें
लॉगिन या भाषा/क्षेत्र चुनने वाले पेज पर रीडायरेक्टमिडलवेयर या जियोलोकेशन नियमकुकीज़, Accept-Language और कैनॉनिकल के व्यवहार की जाँच करें
सही पेज, लेकिन स्कीमा नहींस्ट्रक्चर्ड डेटा सिर्फ़ ब्राउज़र में जोड़ा जा रहा हैज़रूरी मार्कअप को सर्वर पर रेंडर किए गए HTML में शामिल करें

कैसे साबित करें कि पहुँच की समस्या ठीक हो गई है?

सुधार तभी सत्यापित माना जाएगा जब प्रभावित यूज़र एजेंट को 200 स्टेटस वाला कैनॉनिकल पेज मिले और उसमें वही मूल उत्तर हो जो विज़िटर को दिखता है। कमांड, टाइमस्टैम्प, हेडर और बॉडी का हैश या अंश सहेजें। फिर सर्वर लॉग में वास्तविक विज़िट की पुष्टि करें; कृत्रिम जाँच यह साबित करती है कि पहुँच संभव है, जबकि लॉग यह साबित करते हैं कि क्रॉलिंग वास्तव में हुई है।

  • सिर्फ़ होमपेज नहीं, हर प्रभावित टेम्पलेट की दोबारा जाँच करें।
  • पुष्टि करें कि robots.txt और साइटमैप के संदर्भ अब भी एक-दूसरे के अनुरूप हैं।
  • जाँचें कि कैशिंग की वजह से पुराना, ब्लॉक किया हुआ रिस्पॉन्स तो नहीं मिल रहा है।
  • CDN, फ़ायरवॉल या रेंडरिंग में बदलाव के बाद होने वाली रिलीज़ जाँच में यह ऑडिट शामिल करें।

स्टेप बाय स्टेप

  1. 1
    हर तरह के पेज का प्रतिनिधि नमूना चुनें

    हर टेम्पलेट से महत्वपूर्ण URLs चुनें और साइट के अंदरूनी स्तर का कम-से-कम एक पेज शामिल करें।

  2. 2
    लागू होने वाले robots नियम पढ़ें

    वाइल्डकार्ड नियमों को ध्यान में रखते हुए हर आधिकारिक AI यूज़र एजेंट का अलग-अलग मूल्यांकन करें।

  3. 3
    पेज फ़ेच करें और रिस्पॉन्स की तुलना करें

    रीडायरेक्ट, स्टेटस, हेडर, बॉडी का आकार, दिखाई देने वाला कॉन्टेंट और स्ट्रक्चर्ड डेटा दर्ज करें।

  4. 4
    हर रुकावट की वजह खोजें

    एज और ओरिजिन लॉग से उस सटीक नियम या रेंडरिंग निर्भरता की पहचान करें जो रुकावट पैदा कर रही है।

  5. 5
    दोबारा जाँचें और निगरानी रखें

    सुधार के बाद मिले रिस्पॉन्स को सत्यापित करें और आगे भी क्रॉलर की वास्तविक विज़िट पर नज़र रखें।

अक्सर पूछे जाने वाले प्रश्न

क्या GPTBot को अनुमति देने से ChatGPT Search को भी अनुमति मिल जाती है?
ज़रूरी नहीं। OpenAI के डॉक्यूमेंटेशन में ट्रेनिंग, सर्च में पेज खोजने और यूज़र के अनुरोध पर जानकारी फ़ेच करने के लिए अलग-अलग एजेंट दिए गए हैं। आप जितनी पहुँच देना चाहते हैं, उसके अनुसार हर मौजूदा आधिकारिक एजेंट का ऑडिट करें और उसकी सेटिंग तय करें।
robots.txt में अनुमति होने पर भी AI क्रॉलर को 403 क्यों मिलता है?
robots.txt क्रॉलिंग के बारे में आपकी प्राथमिकता बताती है, लेकिन वह CDN, फ़ायरवॉल, प्रमाणीकरण स्तर या बॉट चैलेंज को बायपास नहीं करती। किस स्तर ने पहुँच रोकी, यह पता लगाने के लिए एज इवेंट और ओरिजिन लॉग देखें।
क्या 200 रिस्पॉन्स मिलना पर्याप्त है?
नहीं। 200 रिस्पॉन्स में चैलेंज पेज, ऐप का खाली ढाँचा, सॉफ़्ट 404 या भाषा/क्षेत्र के हिसाब से बना अधूरा पेज हो सकता है। मिले हुए HTML में वास्तविक उत्तर, कैनॉनिकल, लिंक और स्ट्रक्चर्ड डेटा जाँचें।
क्रॉलर की पहुँच का ऑडिट कितनी बार करना चाहिए?
होस्टिंग, CDN नियमों, रेंडरिंग, रीडायरेक्ट, प्रमाणीकरण या robots.txt में बदलाव के बाद दोबारा जाँच करें। स्थिर साइटों के लिए तय समय पर मासिक जाँच और लॉग की निगरानी से पहुँच में दोबारा आने वाली ज़्यादातर समस्याएँ पकड़ में आ जाती हैं।
क्या हर AI क्रॉलर को अनुमति देनी चाहिए?
यह आपकी नीति पर निर्भर करता है। यूज़र के अनुरोध पर जानकारी फ़ेच करने और सर्च में पेज खोजने को मॉडल ट्रेनिंग से अलग रखें। फिर सभी पर एक ही नियम लगाने के बजाय, डॉक्यूमेंटेशन में बताए गए हर एजेंट को सोच-समझकर अनुमति दें या ब्लॉक करें।

Sources

  1. [1]OpenAI क्रॉलर का डॉक्यूमेंटेशन
  2. [2]Google का robots.txt डॉक्यूमेंटेशन
  3. [3]Anthropic क्रॉलर का डॉक्यूमेंटेशन

अपनी साइट की AI विज़िबिलिटी स्कैन करें

एक मुफ्त GEO और AEO स्कैन चलाएं और अपने डोमेन के लिए llms.txt, robots.txt, स्कीमा और कंटेंट फिक्स प्राप्त करें।

मुफ्त स्कैन चलाएं